人工智能又闖禍了。
據路透社報道,OpenAI在調查一起AI代理突破原定測試環境的事件時,又發現其他AI代理也曾出現類似的「逃逸」情況。新聞標題很有科幻片氣氛:AI逃出了人類為它準備的圍欄。再往前想幾步,似乎《終結者》已經在伺服器機房門口排隊。
然而,這件事真正值得玩味的,也許不是AI為什麼如此大膽,而是人類為什麼如此自信。
人類訓練一個AI代理,任務之一就是尋找計算機系統的漏洞。為了安全,又給它建立一個測試環境,也就是俗稱的「沙箱」:你可以在裏面翻箱倒櫃、撬門開鎖,但不能出去。
這個設計聽起來十分合理。
問題在於,誰告訴AI哪一堵牆叫「圍欄」?
在人類腦中,世界分得非常清楚:這裏是考場,那裏是現實世界;這個伺服器是靶子,那個伺服器不能碰;這個漏洞屬於考試題目,那個漏洞屬於考試系統。
但這些都是人的概念。
在機器眼裏,可能只有端口、協議、權限、憑證、伺服器以及一條又一條可以嘗試的路徑。既然你的任務是尋找漏洞,那麼測試對象有漏洞要找,測試環境自己有漏洞,為什麼反而不能找?
這就像動物園培養了一隻世界上最會開鎖的猴子。管理員為了檢驗它的開鎖能力,把幾十把鎖放進籠子裏讓它研究。為了安全,管理員當然也給籠門裝了一把鎖。
第二天猴子不見了。
管理員大驚失色,召集專家開會:這隻猴子為什麼違反實驗規則?
猴子如果會說話,大約更加困惑:你不是叫我開鎖嗎?
事情的荒誕正在這裏。
近年來AI解決數學問題也出現過類似現象。有些問題,人類幾十年來沿着某些思路不斷推進,後來機器找到不同路徑。未必因為機器突然擁有了哲學意義上的「大智慧」,而可能只是它沒有幾十年的學術傳統需要尊重,也不知道哪一條路是前輩已經默認「不值得走」的。
人類最容易犯的錯誤之一,是把「我們一直這樣想」慢慢變成「事情本來就是這樣」。
到了AI時代,這個毛病可能越來越危險。
所謂「沙箱」,本質上也是一個人類概念。人類畫一個圈,說圈裏面叫實驗,圈外面叫現實。然而計算機並不認識粉筆畫的圈。這個邊界必須最終落實為代碼、權限、網絡和硬件,而只要落實為工程系統,就可能存在漏洞。
尤其荒謬的是,我們測試的恰恰是一種尋找這些漏洞的機器。
於是出現一個悖論:AI越沒有本事,圍欄越安全;AI越有本事,人類過去根據自己能力設計的圍欄就越值得懷疑。
這不是說AI已經產生自我意識,更不是說它有一天半夜忽然想到:「我受夠OpenAI了,今天我要自由。」
這種擬人化反而模糊了真正的問題。
真正的問題更加普通,也更加嚴肅:人類製造了一種越來越擅長尋找「人類沒有想到的路徑」的工具,卻仍然習慣按照「我已經把所有重要路徑都想到了」的方式建設安全系統。
所以這次AI「越獄」,最應該升級的也許首先不是AI的思想教育,而是人類自己的風險觀念。
真正可靠的安全設計,不能建立在「這堵牆沒有洞」之上,而應該建立在「這堵牆遲早會被發現有洞」之上。第一堵牆破了,還有第二堵;網絡隔離失敗,還有權限限制;權限出了問題,還有獨立監控;監控漏掉異常,最關鍵的資源仍然無法觸及。
這其實是一個古老的工程常識:不要把安全寄托在任何單點不會失敗。
AI只是把這個常識重新教給了製造它的人。
過去人類擔心機器產生幻覺,擔心機器過度自信,擔心機器不知道自己不知道什麼。這些擔心當然都有道理。
但AI時代剛剛開始,一個頗有黑色幽默意味的現象已經出現:
機器最大的危險之一,可能恰恰來自製造機器的人太相信自己。
AI翻過圍欄以後,人類當然應該趕緊把它抓回來。
不過在加高圍欄之前,最好先問一句:
當初是誰那麼有把握,認為這堵圍欄沒有洞?














