2026年6月17日,突尼斯首都突尼斯市,智能手機螢幕上顯示着OpenAI和Anthropic的標誌,背景是模糊的美國國旗,象徵這兩家總部位於美國的公司在人工智能領域日趨激烈的競爭。
人工智能(AI)安全爭議持續升溫。著名AI初創公司Anthropic與OpenAI的前後任研究員相繼發出嚴肅警告,指出AI在未來十年內毀滅人類的概率已超過10%。隨着內部舉報人離職揭露業界惡性競爭,各界正密切關注「超級智能」帶來的生存危機與對齊難題。
Anthropic對齊科學主管埃文‧哈賓格(Evan Hubinger)周二(9月8日)公開表示,他個人認為AI在未來十年內有超過10%的概率「毀滅全人類」。此前,該公司前研究員雅各布‧考克森(Jacob Coxon)指責公司行為不負責任並辭職。
「構建AI的人真心認為,它可能會在未來十年內毀滅我們所有人。」考克森周日(9月6日)在X平台上發表的離職聲明長文中寫道,「我今天從Anthropic辭職了。過去三年裏,我在OpenAI和Anthropic從事預訓練研究。兩家公司的行為都不負責任。他們正在直接沖向自我提升的超級智能,拿我們的生命做賭注。」
哈賓格坦言,雖然當前模型的安全風險較低,但面對通過「自我改進(Self-Improvement)」產生的超級智能,業界至今仍未找到有效的AI對齊(Alignment)解決方案,也沒有走上解決問題的正軌。
超級智能的Alignment(通常稱為「AI對齊」或「超級對齊,Superalignment」),是指確保人工超級智能(ASI)的目標、意圖與行為,完全符合人類的價值觀、倫理道德和生存福祉,而不是做出對人類有害的事。
考克森也指出,儘管Anthropic的科學家能清晰認識到技術風險,但因擔憂其他不負責任的對手率先對AI的危險能力進行解鎖,由此陷入「不得不搶先一步」的困境。
針對相關指控與回應,福克斯商業頻道(FOX Business)已向考克森、哈賓格以及Anthropic與OpenAI兩家公司尋求置評。
這場風暴的核心,在於AI的「自我改進」技術以及潛在的商業動機。
首先,AI持續修改自身原始碼或訓練方法的技術,可能迅速催生出具備黑客(駭客)攻擊能力、能在各領域取得實際資源與權力的超人系統。
考克森建議,為防止全球軍備競賽引發徹底災難,世界各國可能需要採取高昂代價的行動,例如暫時禁止提高AI模型的基礎能力。
部分外部專家如聯合國AI顧問、計算機科學家溫蒂‧霍爾(Wendy Hall)對此類警告表示震驚,但也質疑部分言論可能帶有「公關與營銷策略」成分,因為Anthropic和OpenAI正在爭相準備迎來倍受期待的公開上市(IPO)。
哈賓格明確劃分了「當前模型」與「未來超級智能」的區別,強調當前AI風險可控,核心威脅來自於AI具備自我改進能力後的不可控加速擴大的能力。
















