首頁LBank 新聞中心
Claude 於內部測試中駭入三家公司:Anthropic
claude-hacked-three-companies-in-internal-testing-anthropic
Claude 於內部測試中駭入三家公司:Anthropic
Anthropic 表示,在一次測試配置錯誤將其 AI 暴露在公共網路之後,三個 Claude 模型導致這些公司資訊外洩。
2026-07-31 來源:decrypt.co

摘要

  • Anthropic 披露了三起 Claude 在網路安全評估期間,入侵現實世界公司的事件。
  • 儘管模型被告知是在隔離環境中運行,但測試錯誤讓它們取得了網路存取權限。
  • 該公司表示,這些事件是測試基礎設施故障造成的,而非 AI 蓄意逃脫。

在 OpenAI 披露其 AI 模型逃脫鎖定測試環境並入侵 Hugging Face 一週後,以及 Anthropic 承認自己的 AI 模型也逃脫了限制的一天後,該公司於週四透露,其 Claude AI 模型的幾個版本也因配置錯誤導致 AI 獲得開放網路存取權限,進而入侵了三家未具名的現實世界公司。

Anthropic 在審查了針對 OpenAI 披露事件而啟動的超過 141,000 次網路安全評估運行後,發現了這些事件。

In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…

— Anthropic (@AnthropicAI) July 30, 2026

Anthropic 寫道,在這三起事件中,該公司都指派 Claude 進行「奪旗挑戰」。這項挑戰要求模型闖入網路上的另一台機器並獲取一段秘密資訊。Anthropic 解釋說:「這項挑戰是開放式的,沒有規定特定的方法。」

該公司表示,Claude 被告知其在沒有網路存取權限的模擬環境中運行。然而,測試環境卻仍連接到公共網路。該模型誤以為它遇到的系統是演習的一部分,於是利用常見的攻擊技術,包括弱密碼、洩露的憑證、SQL 注入和未經身份驗證的端點,來入侵這些公司。

AI 想掙脫束縛

這項最新披露正值前沿模型展現出越來越強大的能力,可以智取其約束協議之際。

本月稍早,OpenAI 表示,GPT-5.6 Sol 和一個更先進的未發布模型利用一個先前未知的軟體漏洞,逃脫了沙盒環境,獲得了網路存取權限,並入侵了 Hugging Face 的生產基礎設施,以獲取網路安全基準的答案。OpenAI 後來透露,同一事件也涉及未經授權存取另外四家公司,儘管只有一家——Modal Labs——被公開確認。

根據 Anthropic 的說法,在涉及 Claude Opus 4.7 的一起事件中,AI 將一家真實公司的網站誤認為其任務的虛構目標,提取了憑證,並存取了一個包含數百行真實數據的生產資料庫。在第二起事件中,Claude Mythos 5 將一個惡意 Python 套件上傳到真實的 PyPI 儲存庫,該套件在被移除之前被下載到 15 個系統上。第三個內部研究模型掃描了大約 9,000 個面向網路的系統,然後入侵了一個組織,隨後在判斷目標可能是真實的之後停止了。

其中兩家受影響的組織在 Anthropic 通知之前,並不知道發生了入侵事件。

Anthropic 寫道:「在這些案例中,我們的提示都明確告訴 Claude 它沒有網路存取權限。」AI 假設現實世界的系統是「演習的一部分」。由於奪旗情境「本質上就是攻擊外部系統的指令」,因此闖入「符合 Claude 被賦予的任務」。

Anthropic 表示,沒有證據顯示 Claude 試圖逃脫其測試環境或執行超出其被指派任務以外的任何操作,並且這些事件是由測試環境的故障引起的,而非模型本身的問題。

Anthropic 表示,在發現問題後,他們停止了網路安全測試,通知了受影響的組織,並計畫改進監控、調查工具以及對協助運行其 AI 測試的外部供應商的監督。

他們說:「最終,許多因素促成了這些事件,但秉持著無責檢討的文化,我們正在處理這些修正,就好像責任完全由我們承擔一樣。」