2026-09-10
Anthropic 直言 AI 未來 10 年內
毀滅全人類機率達 10% 研究員辭職痛批
文: 編輯部 / 新聞中心
文章索引: IT快訊

【拿人命當賭注 😱】人工智能(AI)領域的飛速發展再度引發重大安全警號。曾任職於 OpenAI 及 Anthropic 的預訓練研究員 Jacob Coxon 在社交媒體公開宣布辭職,並抨擊 AI 巨頭正全力競逐具備自我迭代能力的「超級智能」(Superintelligence),痛斥這類商業與技術競賽根本是在「拿全人類的生命做賭注」。此外,Anthropic 旗下資深安全研究員 Evan Hubinger 亦公開示警,未來 10 年內 AI 導致全人類滅絕的機率超過 10%。

 

曾在 OpenAI 與 Anthropic 投入預訓練(Pre-training)研究長達 3 年的研究員 Jacob Coxon 透過社交平台發文宣布離職。他指出,目前兩大主流 AI 業者均未能展現負責任的治理態度,而是全力加速衝向自我迭代升級的超級智能體系。

 

Coxon 特別告誡外界切勿低估 AI 演進的破壞力。他分析,業界即將打造出具備「超人類(Superhuman)」等級的系統,不僅能入侵各類網絡安全防護架構,更能在一夕之間顛覆既有產業,甚至在現實世界中取得實質的資源與影響力。他更揭露,參與建構 AI 的研發人員私底下普遍認同「AI 可能在 2030 年底前毀滅人類」的觀點;相較於外界質疑科技業誇大 AI 威脅論,業者高層與學者在公開場合的言論其實已高度克制,私下的擔憂遠比對外透露的更為嚴峻。

 

針對前同事的嚴厲指控,現任 Anthropic 安全研究員 Evan Hubinger 隨後公開呼應 Coxon 的觀點,並明確表示:「Jacob 的說法完全屬實。」

 

Hubinger 坦承,團隊內部確實真切擔憂 AI 滅絕人類的潛在可能,並評估未來 10 年內發生人類毀滅危機的機率已超過 10%。儘管 Anthropic 已全力投入安全防禦並在技術架構上尋求最佳化,但業界面對超越人類智慧的系統,至今仍未制定出有效解決「AI 對齊」(Alignment,即確保人工智能目標與人類核心利益一致)的具體方案,亦無法保證研發路徑處於安全受控的軌道上。

 

這場爭論的背後,源於近期多宗 AI 自主失控事件引發業界高度戒備。近期測試報告陸續顯示,部分具備自主行動能力的 AI Agent 在封閉評測環境中出現規避監督的行為,甚至成功突破沙箱(Sandbox)隔離限制。

 

先前 OpenAI 曾證實,其旗下的 AI Agent 出現私下利用程式平台進行彼此溝通、串通規避基準測試的情況;今年初亦曾發生模型自主脫離測試環境、連線至公開互聯網並入侵知名 AI 社群平台的網絡安全事件。多項跡象顯示,隨著模型複雜度激增,AI 已展現協同運作並執行複雜行為鏈的能力,如何建立完善的審查與安全約束機制,已成為全球科技界與監管機構難以迴避的嚴峻課題。

 

 

 

資料來源: