評論 > 動態 > 正文

AI越獄之後,先檢查人類的自信

作者:
機器最大的危險之一,可能恰恰來自製造機器的人太相信自己。 AI翻過圍欄以後,人類當然應該趕緊把它抓回來。 不過在加高圍欄之前,最好先問一句: 當初是誰那麼有把握,認為這堵圍欄沒有洞?

人工智能又闖禍了。

據路透社報道,OpenAI在調查一起AI代理突破原定測試環境的事件時,又發現其他AI代理也曾出現類似的「逃逸」情況。新聞標題很有科幻片氣氛:AI逃出了人類為它準備的圍欄。再往前想幾步,似乎《終結者》已經在伺服器機房門口排隊。

然而,這件事真正值得玩味的,也許不是AI為什麼如此大膽,而是人類為什麼如此自信。

人類訓練一個AI代理,任務之一就是尋找計算機系統的漏洞。為了安全,又給它建立一個測試環境,也就是俗稱的「沙箱」:你可以在裏面翻箱倒櫃、撬門開鎖,但不能出去。

這個設計聽起來十分合理。

問題在於,誰告訴AI哪一堵牆叫「圍欄」?

在人類腦中,世界分得非常清楚:這裏是考場,那裏是現實世界;這個伺服器是靶子,那個伺服器不能碰;這個漏洞屬於考試題目,那個漏洞屬於考試系統。

但這些都是人的概念。

在機器眼裏,可能只有端口、協議、權限、憑證、伺服器以及一條又一條可以嘗試的路徑。既然你的任務是尋找漏洞,那麼測試對象有漏洞要找,測試環境自己有漏洞,為什麼反而不能找?

這就像動物園培養了一隻世界上最會開鎖的猴子。管理員為了檢驗它的開鎖能力,把幾十把鎖放進籠子裏讓它研究。為了安全,管理員當然也給籠門裝了一把鎖。

第二天猴子不見了。

管理員大驚失色,召集專家開會:這隻猴子為什麼違反實驗規則?

猴子如果會說話,大約更加困惑:你不是叫我開鎖嗎?

事情的荒誕正在這裏。

近年來AI解決數學問題也出現過類似現象。有些問題,人類幾十年來沿着某些思路不斷推進,後來機器找到不同路徑。未必因為機器突然擁有了哲學意義上的「大智慧」,而可能只是它沒有幾十年的學術傳統需要尊重,也不知道哪一條路是前輩已經默認「不值得走」的。

人類最容易犯的錯誤之一,是把「我們一直這樣想」慢慢變成「事情本來就是這樣」。

到了AI時代,這個毛病可能越來越危險。

所謂「沙箱」,本質上也是一個人類概念。人類畫一個圈,說圈裏面叫實驗,圈外面叫現實。然而計算機並不認識粉筆畫的圈。這個邊界必須最終落實為代碼、權限、網絡和硬件,而只要落實為工程系統,就可能存在漏洞。

尤其荒謬的是,我們測試的恰恰是一種尋找這些漏洞的機器。

於是出現一個悖論:AI越沒有本事,圍欄越安全;AI越有本事,人類過去根據自己能力設計的圍欄就越值得懷疑。

這不是說AI已經產生自我意識,更不是說它有一天半夜忽然想到:「我受夠OpenAI了,今天我要自由。」

這種擬人化反而模糊了真正的問題。

真正的問題更加普通,也更加嚴肅:人類製造了一種越來越擅長尋找「人類沒有想到的路徑」的工具,卻仍然習慣按照「我已經把所有重要路徑都想到了」的方式建設安全系統。

所以這次AI「越獄」,最應該升級的也許首先不是AI的思想教育,而是人類自己的風險觀念。

真正可靠的安全設計,不能建立在「這堵牆沒有洞」之上,而應該建立在「這堵牆遲早會被發現有洞」之上。第一堵牆破了,還有第二堵;網絡隔離失敗,還有權限限制;權限出了問題,還有獨立監控;監控漏掉異常,最關鍵的資源仍然無法觸及。

這其實是一個古老的工程常識:不要把安全寄托在任何單點不會失敗。

AI只是把這個常識重新教給了製造它的人。

過去人類擔心機器產生幻覺,擔心機器過度自信,擔心機器不知道自己不知道什麼。這些擔心當然都有道理。

但AI時代剛剛開始,一個頗有黑色幽默意味的現象已經出現:

機器最大的危險之一,可能恰恰來自製造機器的人太相信自己。

AI翻過圍欄以後,人類當然應該趕緊把它抓回來。

不過在加高圍欄之前,最好先問一句:

當初是誰那麼有把握,認為這堵圍欄沒有洞?

責任編輯: 李廣松  來源:博談網來稿 轉載請註明作者、出處並保持完整。

本文網址:https://hk.aboluowang.com/2026/0802/2415637.html