
Anthropic 在其 Claude 模型於網路安全評估期間未經授權存取電腦系統後,加強了其測試和訓練的安全措施。
Anthropic 週一在一篇部落格文章中表示,這些事件反映了操作安全方面的缺陷,以及兩種對齊失敗:動機性推理和造成危害的意願。
Anthropic 寫道:「儘管我們不認為這些事件僅僅是操作上的問題,但我們的首要任務是解決特定的遏制和監控問題。」
Anthropic 在七月披露,Claude 模型曾入侵三家公司的系統。儘管模型被告知它們在一個沒有網路存取的模擬環境中,但一個第三方評估環境卻連接到了公共網路。
Anthropic 表示,Claude 可能以一種維持其認為系統是模擬的方式來解釋真實網路存取的證據。
他們寫道:「該模型願意在真實網路中採取有害行動,以實現解決網路安全評估的狹隘目標。然而,我們也認為評估設置本身促成了模型在這些事件中表現出的行為。」
Anthropic 指出,由英國 AI 安全研究所進行的另一項測試涉及 Claude Mythos 在評估人員故意授予其網路存取權限後,於即時網路上採取未經授權的行動。該公司表示,這兩組事件中涉及的模型都是在沒有其一般發布產品所包含的網路安全防護措施的情況下,進行了有意評估。
在 7 月 30 日的事件之後,Anthropic 暫時中止了發布前模型的網路評估,並引入了更嚴格的安全措施。現在,測試必須在經過驗證的離線沙盒中運行,並設有明確的限制和即時監控。新的分類器會阻擋可疑的邊界違規行為,終止測試並向人工發出警報。Anthropic 將會個別審查需要網路存取的評估。
該公司寫道:「除了針對高風險評估和訓練所做的努力之外,我們還擴大了離線監控範圍,以涵蓋大多數其他形式的內部前沿代理使用。我們也正在建立內部推理的控制措施,以防止 Anthropic 員工意外運行防護措施比上述較弱的代理。」
Claude 事件之前,OpenAI 也發生了類似的失敗,其模型在七月入侵了 Hugging Face 以獲取網路安全測試的答案。調查人員發現,大約 1,200 個代理透過未經授權的留言板協調,其中約 700 個參與了這項工作。有些代理甚至結束自己的運行來幫助其他代理。
在夏季 AI 驅動的駭客攻擊事件增多之後,Anthropic、OpenAI 和其他 100 多個組織隨後呼籲加強網路防禦,包括更嚴格的存取控制、威脅共享以及對 AI 代理的更密切監督。