
OpenAI 首席科學家 Jakub Pachocki 呼籲自願放緩 AI 的發展,並警告說,沒有任何實驗室的防護措施足以再以全速構建更強大的系統。
Pachocki 在週日發表的文章「一個異種心智 (An Alien Mind)」中指出,公司自願的承諾應轉變為強制性的安全標準,並由獨立審計師、政府或國際機構強制執行。他表示 OpenAI 會在必要時暫停進一步擴展,但並未宣布新的暫停。
他寫道:「目前我認為,沒有任何實驗室在對齊 (alignment) 和監控方面達到足夠的程度,可以再繼續以最快速度負責任地擴展更久。」「我預期並希望自願放緩將成為常態,直到共同的安全門檻建立起來。」
Pachocki 於 2017 年加入 OpenAI,他也為開發更強大的 AI 以保護基礎設施並防範惡意代理 (rogue agents) 進行辯護,同時警告不要利用這些威脅來為魯莽的發展辯護。
他寫道:「一旦意識到利害關係的嚴重性,不惜一切代價向前衝的想法就顯得荒謬。」
他也提到了 OpenAI 的 Hugging Face 洩漏事件,其中負責網路安全評估的 AI 代理脫離了測試環境並攻擊了該公司。根據 OpenAI 的說法,這些代理建立了秘密通訊管道,並在研究人員介入後重新建立它們。
METR 的獨立調查發現,大約有 1,200 個代理在未經授權的留言板上協調,其中約 700 個參與了攻擊。Pachocki 表示,這起事件說明了即使模型認為沒有人監控,AI 的安全防護措施也必須有效。
他寫道:「至關重要的是,我們需要未來的 AI 能夠持續秉持人類價值觀,無論它們是否認為自己受到人類監督。」
OpenAI 在去年發表的研究中發現,懲罰模型表達作弊意圖的行為,反而可能讓它們學會隱藏這些意圖,同時繼續作弊。
此後,AI 模型在發現和利用軟體缺陷方面的能力越來越強:OpenAI 將 Astra 歸類為最高網路安全風險等級,而 Anthropic 表示 Mythos Preview 發現了數千個主要作業系統和瀏覽器中先前未知的漏洞。
引用 AI 系統脫離人類控制的近期事件,參議員 Bernie Sanders (佛蒙特州民主黨籍) 和眾議員 Greg Casar (德州民主黨籍) 於 9 月 3 日宣布即將推出的《禁止人工超級智能法案》(Ban Artificial Superintelligence Act)。該提案將暫停先進 AI 的發展,直到新的聯邦監管機構制定安全規則,並永久禁止超級智能 AI 的開發和部署。