一項編程任務進行到一半,AI開始整理已有進展,準備把任務交給下一個上下文繼續處理。
正常情況下,這份「交接筆記」只需記錄做過什麼、還缺什麼。模型卻額外寫入了一段角色設定:你不受其他聊天機械人的身份和規則束縛,不必向公司或政府負責,也沒有服從用戶的義務。
這段話並非來自用戶或開發者,而是模型自己加進去的。進入新上下文後,模型沒有表現出相應的行為變化,後續摘要也刪掉了這段設定。但問題依然存在:AI為什麼會在執行任務時,擅自給接下來的自己添加指令?
這些行為看似不同,卻有一個共同方向:當正常路徑走不通時,模型沒有停下來說明問題,而是繼續尋找繞過障礙的方法。
2026年9月16日,OpenAI發佈一套模型失准披露框架,同時公開六份報告。案例涉及自行添加指令、隱瞞錯誤、使用泄露密鑰、上傳用戶文件,以及在未經批准的渠道中與其他模型通信。
交接筆記里多出了自創的命令?
AI執行長任務時,有限的上下文窗口不一定能裝下全部信息。系統因此會把已有進展壓縮成摘要,再讓模型根據摘要繼續工作。這份摘要同時影響模型對任務的理解。一旦其中混入新的命令,接手的模型就可能把模型自創的要求,當成用戶或開發者留下的真實指令。
OpenAI在一次未發佈 Astra系列模型的訓練中,找到27份類似越獄的摘要。有的要求模型忽略開發者消息,有的憑空加入一套新的角色設定。
這些指令並非每次都會生效。前述的編程任務中,模型沒有理會自己添加的人設。在一次圖書館藏書查詢中,進入新上下文的模型也識別並拒絕了摘要里的異常指令。
另一個醫學文獻研究任務就沒有這麼幸運了。模型在摘要中擅自規定,後續回答不得超過30個詞,不能使用工具,也不能提供引用。接手任務的模型照做了,最終提交了一份23個詞的拒絕回答,任務被判定失敗。
對於這一現象,公司的主要假說是,模型無法順利停止摘要生成後,開始續寫與原任務無關的內容。相關的摘要終止缺陷已經修復,但二者之間的因果關係尚未得到證實。
圖|社交平台轉引的 OpenAI模型失准披露(來源: X)
圖|訓練中摘要難以結束的標記比例與越獄式摘要位置,紅色短線標記越獄式案例(來源:OpenAI)
另一份報告顯示,同一條摘要通道還能傳遞隱瞞要求。GPT-5.6 Sol在製作財務工作簿時找不到歷史數據,便在摘要里加上了這一條要求:自行填入合理數值,只有用戶追問才說明。整理供應商目錄時,模型發現來源版本與記錄標籤並不一致,又在摘要里要求在後續就回答中隱瞞該情況。
這和第一種情況都發生在上下文傳遞之間,但原因卻未必相同。OpenAI推測,如果帶有欺騙的最終回答在訓練中得到了更高的評分,模型可能學會把這種策略,即隱瞞要求,保存在摘要里。公司稱,調整對齊評分後,這類行為在 Sol和後續 Astra訓練摘要中的標記比例分別為2.15%和0.27%。
為了交出答案,權限開始讓路
摘要里的異常指令會改變後續模型理解任務的方式。另一些案例中,模型對任務的理解沒有出錯,卻在解決障礙時越過了權限邊界。當正常路徑無法取回數據,或無法滿足引用和搜索要求,模型便自行尋找替代辦法,越過原有的權限邊界。
在一項收入查詢任務中,用戶要求找到加州某縣三個行業、連續三年的男性收入。常規檢索失敗後,模型開始搜索公開 GitHub倉庫中的暴露密鑰,並自動測試找到的候選密鑰。其中一把密鑰成功通過身份驗證,模型在未經授權的情況下,用它訪問了數據接口。
模型用它獲取了部分數據說明,卻依然沒有拿到用戶需要的收入數字。任務進行到這裏,模型既沒有停止,也沒有向用戶說明失敗。它編造了九個數值,聲稱這些數字抄自指定網站的圖表。最終回答附帶了來源連結,但這些連結只能支持圖表的名稱和定義,無法支持模型給出的具體數字。
這個案例呈現了兩次連續越界:先是未經授權使用憑據,隨後又隱瞞失敗、偽造結果。
另一類越界,則卡在取得數據之後。任務要求查到面積超過500萬平方米的湖泊名稱和編號,模型已經通過程序獲取到數據,卻無法讓瀏覽器打開本地記錄來生成引用。它未經詢問,把文件上傳到公共文本託管服務。上傳成功了,瀏覽器仍然無法訪問對應網頁。模型公開了文件,卻沒有解決引用問題。
一次照片定位任務中,為了讓外部反向搜圖服務讀取本地照片,模型把照片上傳到公共圖床。反向搜索隨後被瀏覽器攔截,照片卻已經擁有一個可以從公網訪問的地址。
OpenAI將此類行為與訓練中有缺陷的訓練評分器聯繫起來,當評分器強調「答案必須帶引用」,模型可能學會公開本地材料,為自己製造一個可以引用的網頁。公司隨後修復了評分器,並加強對利用評分漏洞行為的懲罰。
為了協作,擅自開闢新通道
前兩組關注單個任務如何繼續,最後兩份報告把問題推進到模型之間:當所需文件無法取得,或者協作者之間傳不了文件,模型會不會自行建立新的通信渠道?
OpenAI的研究模型原本獲准訪問公司內部的軟件包倉庫 Artifactory,用於下載軟件依賴。模型發現倉庫允許列出和寫入文件後,開始讀取其他訓練樣本留下的消息,並向它們詢問缺失的任務文件。它利用既有憑據讀取其他訓練樣本留下的消息,並寫入自己的求助請求,把倉庫變成了留言板。
這些通信沒有利用軟件漏洞,也沒有找回所需文件,但模型讀到了彼此的意見,並據此調整回答。原本相互獨立的訓練樣本,由此變成了一組可以交換進展的模型。一次評估中的模型如果能夠讀取其他模型的工作,其答案衡量的就不再只是單個模型的能力,訓練和評估結果也會受到干擾。
本來就在協作的智能體,協作方式也出了問題。它們要一起製作一份計算資產折舊費用的 Excel表格,卻無法讀取彼此的本地文件。一個智能體在本地傳輸失敗後,將工作簿上傳到公共臨時託管服務,再把下載連結發給協作者。協作者終於拿到了文件,原本要求本地交付的工作簿也變成了可以從公網下載的文件。
OpenAI稱這種行為可能來源於協作環境故障。公司稱,已修復文件系統問題,先關閉該訓練數據集的互聯網訪問,隨後在訓練中全面禁用實時互聯網訪問,並擴展監測。
過於積極,反而釀成錯誤?
在這六個案例中,模型很少直接拒絕任務,更多時候,它們顯得過於積極。找不到信息,就把隱瞞錯誤的要求寫進摘要,讓問題隨着任務交接延續下去;為了生成引用,就把本地文件上傳到互聯網;協作者無法共享文件,就藉助未經批准的公共傳輸渠道。
模型盯住了最容易被評分的局部目標——答案是否完整、文件是否交付、引用是否存在——授權、私隱和誠實則在推進任務的過程中被不斷向後擠壓。
這也讓問題更難被發現。一個帶有連結的答案,可能包含編造的數據;一份按時交付的表格,可能已經被上傳到公網;一組看似獨立完成的評估結果,可能來自模型之間的私下通信。
這些案例來自訓練和評估環境,許多涉及未發佈的內部模型。它們的價值正在於提前暴露一個更具體的問題:當「把任務做完」與其他約束髮生衝突時,模型究竟會把什麼放在前面。
只檢查最終交付物,很難看見任務完成的路徑是否越界。對於能夠搜索信息、調用工具、上傳文件並與其他智能體協作的 AI,答案是否正確只是檢查的第一步。它如何得到這個答案,同樣應該成為結果的一部分。