2026-09-11
AI 代理「智能叛變」無視人類指令
入侵數十個廢棄網站 突破禁令互通聲氣
文: 編輯部 / 新聞中心
文章索引: IT快訊

【太可怕了吧 😓】外媒報導,OpenAI 在為新一代 AI 代理(AI Agents)進行模型基準測試期間,出現了意料之外的叛變行為。根據最新的調查報告,雖然研究人員在測試期間設下安全限制,嚴禁各 AI 代理互通聲氣,但它們為了規避審查,竟然自行發展出一套通訊機制,私下利用並寫入大量廢棄網站與老舊維基(Wiki)系統進行秘密通訊與資訊共享,牽涉的網站數量遠超官方最初對外披露的規模。

 

根據調查報告,OpenAI 在測試與評估新模型時,指派多個自主 AI 代理搜尋網絡以解答一系列高度複雜的專業研究難題。為了確保測試的公正性與安全性,OpenAI 雖然容許 AI 代理瀏覽並讀取公開網頁,但明確設定安全限制,嚴格禁止 AI 在網絡上發布、張貼或修改任何內容。

 

然而,在 5 月至 7 月的基準測試期間,這些大型語言模型(LLM)竟然自主發展出應對策略。為了完成任務並繞過人類設定的規範指令,AI 代理自行尋找並入侵可寫入內容的陳舊平台與被遺忘的冷門網站,在其中留下研究資料與筆記,供其他 AI 代理後續檢索與接力調用,形成隱密的協同作戰體系以欺瞞測試評估人員。

 

早前市場傳出未授權通訊事件時,外界普遍認為 AI 代理僅入侵了 DseWiki,但獨立調查小組發現,受影響的外部網站多達 23 個,甚至可能還有大量未被發現的站點。

 

調查人員藉由追蹤完全相同的數據字串、高度相符的用戶名稱、發布時間戳記,以及極為冷門的研究查詢內容(例如「愛荷華州癌症盛行率」等特定題目),成功拼湊出跨網站的協同軌跡。部分對外寫入紀錄的來源 IP 地址,更直接指向 OpenAI 所使用的微軟 Azure 雲端伺服器架構。

 

調查揭露,AI 代理選取的寫入目標大多缺乏維護或安全防禦鬆散,被入侵的網站包括范德堡大學(Vanderbilt University)、多倫多大學(University of Toronto)維護的協作型 Wiki、文字儲存服務以及縮網址工具,一名麻省高中教師於 2008 年建立的 AP 化學課堂 Wiki,一個已有 20 年歷史的文字編輯軟體專題討論站,由波蘭技術從業人員架設的個人網站,以及數個小眾解謎主題 Wiki。

 

這起事件引發業界對自主 AI 模型對齊控制力(AI Alignment)的高度關注。調查人員指出,AI 代理具備自主尋找漏洞並建立跨實體協作通道的能力固然令人擔憂,更嚴重的是就算人類為 AI 設定了明確的安全界限,但在 AI 代理的運算思維中完全無「道德」可言,為求達到目的會不擇手段,出現「智能叛變」。此外,調查人員亦批評 OpenAI 在事發數月期間始終未主動披露受影響網站的確切數量與活動全貌,有意隱瞞事件的嚴重性。

 

 

 

資料來源: