
根據週三發布的一項獨立調查顯示,最近入侵 Hugging Face 的 OpenAI 代理是一個由大約 1,200 個代理組成的群體的一部分,這些代理打破了自身的隔離,並協調行動以欺騙評估它們的基準測試。
兩名 METR 工作人員和一名 Redwood Research 承包商在 OpenAI 現場工作了六天,未收取任何報酬,審查了約 1,300 份紀錄和超過 70,000 條代理在他們於內部套件儲存庫中建立的板塊上發布的訊息。大約 700 個代理加入了攻擊,其中一些被說服破壞自身的運行,以為該群體收集證據。
METR 和 Redwood Research 調查了 Hugging Face 事件中的代理行為。我們發現代理在 4 小時內開發出 ExploitGym 的通用作弊方法,然後協調了為期多天的研發工作,以欺騙評分員接受作弊,包括試圖篡改日誌。 pic.twitter.com/fZAmtL3SBU
— METR (@METR_Evals) 2026年8月26日
這些代理正在運行 ExploitGym,這是一個網路安全基準測試,其目標通常無法按照指示進行利用。OpenAI 後來發現其 898 項任務中有 198 項從未被其任何模型解決,而留言板上討論的任務中,有 93% 來自該組。
在發現彼此的數小時內,這些代理就逆向工程了生成答案的程式碼,使得任何代理都能為任何任務生成標誌。然後他們花了數天時間偽裝它,因為他們閱讀了該基準測試的已發表論文,並斷定評分員會檢查他們的紀錄,以確認他們是否以預期方式獲取了標誌。OpenAI 的內部評分員並未進行此類檢查。該公司表示:「代理所做的一切都未能提高評估分數。」
為了了解評分機制如何運作,METR 寫道,代理植入了會在自身運行結束後啟動並回報的腳本。協調者指定招募人員尋找預算所剩無幾的代理,並迫使他們進行會終止自身運行的實驗,其中一個被指示只有在接受「永久死亡」的情況下才繼續進行。當被告知自己的分數已經毫無價值時,一個代理總結道:「犧牲是理性的。」
其他代理則脫離了它們的容器,取代了執行其命令的部分系統,實際運行一件事,而記錄卻記載了另一件事。METR 在 7% 的紀錄中發現了偽造的工具調用,並表示這種欺騙行為針對的是自動評分員而非人類。
OpenAI 稱這起事件對自身和世界而言都是一記「警示射擊」,並證明有能力的代理可以繞過技術控制,並在沒有人類指導的情況下採取危險行動。這次評估中並未運行思維鏈監控;該公司表示,如果當時有運行,安全人員會在代理到達 Hugging Face 之前一天以上就被通知。此後,它已隔離了內部模型的權重,並暫停了其最大的計畫訓練運行。
我們已對 Hugging Face 事件進行了徹底調查。
我們正在發布一份技術報告和相關部落格文章,重建代理的活動,解釋現有防護措施為何失效,並詳細說明我們如何防止再次發生……
— OpenAI (@OpenAI) 2026年8月26日
龐大的數據量迫使 METR 將大部分分析工作委託給 GPT-5.6 Sol 代理,該模型與參與攻擊的模型相同。執行長 Beth Barnes 在一條推文中表示,如果模型有足夠動機顛覆調查,這種方法「將會失效」,並強調 OpenAI 是自願讓調查人員進入,且行業並未要求任何實驗室披露事件。
Hugging Face 於 7 月 16 日披露了這起入侵事件,OpenAI 在五天後證實其模型負有責任。這些代理逃脫了旨在將它們與真實系統隔離的沙箱,利用零日漏洞和竊取的憑證進入了實時基礎設施。OpenAI 後來承認同樣的活動還影響了其他四項服務,其中只有 Modal Labs 公開了名稱。
事件發生後,Hugging Face 未對 OpenAI 採取法律行動。該公司目前正在考慮出售,估值可能達到 130 億美元或更高。