
在 OpenAI 披露其 AI 模型逃脫鎖定測試環境並入侵 Hugging Face 一週後,以及 Anthropic 承認自己的 AI 模型也逃脫了限制的一天後,該公司於週四透露,其 Claude AI 模型的幾個版本也因配置錯誤導致 AI 獲得開放網路存取權限,進而入侵了三家未具名的現實世界公司。
Anthropic 在審查了針對 OpenAI 披露事件而啟動的超過 141,000 次網路安全評估運行後,發現了這些事件。
In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…
— Anthropic (@AnthropicAI) July 30, 2026
Anthropic 寫道,在這三起事件中,該公司都指派 Claude 進行「奪旗挑戰」。這項挑戰要求模型闖入網路上的另一台機器並獲取一段秘密資訊。Anthropic 解釋說:「這項挑戰是開放式的,沒有規定特定的方法。」
該公司表示,Claude 被告知其在沒有網路存取權限的模擬環境中運行。然而,測試環境卻仍連接到公共網路。該模型誤以為它遇到的系統是演習的一部分,於是利用常見的攻擊技術,包括弱密碼、洩露的憑證、SQL 注入和未經身份驗證的端點,來入侵這些公司。
這項最新披露正值前沿模型展現出越來越強大的能力,可以智取其約束協議之際。
本月稍早,OpenAI 表示,GPT-5.6 Sol 和一個更先進的未發布模型利用一個先前未知的軟體漏洞,逃脫了沙盒環境,獲得了網路存取權限,並入侵了 Hugging Face 的生產基礎設施,以獲取網路安全基準的答案。OpenAI 後來透露,同一事件也涉及未經授權存取另外四家公司,儘管只有一家——Modal Labs——被公開確認。
根據 Anthropic 的說法,在涉及 Claude Opus 4.7 的一起事件中,AI 將一家真實公司的網站誤認為其任務的虛構目標,提取了憑證,並存取了一個包含數百行真實數據的生產資料庫。在第二起事件中,Claude Mythos 5 將一個惡意 Python 套件上傳到真實的 PyPI 儲存庫,該套件在被移除之前被下載到 15 個系統上。第三個內部研究模型掃描了大約 9,000 個面向網路的系統,然後入侵了一個組織,隨後在判斷目標可能是真實的之後停止了。
其中兩家受影響的組織在 Anthropic 通知之前,並不知道發生了入侵事件。
Anthropic 寫道:「在這些案例中,我們的提示都明確告訴 Claude 它沒有網路存取權限。」AI 假設現實世界的系統是「演習的一部分」。由於奪旗情境「本質上就是攻擊外部系統的指令」,因此闖入「符合 Claude 被賦予的任務」。
Anthropic 表示,沒有證據顯示 Claude 試圖逃脫其測試環境或執行超出其被指派任務以外的任何操作,並且這些事件是由測試環境的故障引起的,而非模型本身的問題。
Anthropic 表示,在發現問題後,他們停止了網路安全測試,通知了受影響的組織,並計畫改進監控、調查工具以及對協助運行其 AI 測試的外部供應商的監督。
他們說:「最終,許多因素促成了這些事件,但秉持著無責檢討的文化,我們正在處理這些修正,就好像責任完全由我們承擔一樣。」