首頁LBank 新聞中心
OpenAI 首席科學家警告 AI 實驗室可能需要放慢步調
openai-chief-scientist-warns-ai-slow-down
OpenAI 首席科學家警告 AI 實驗室可能需要放慢步調
Jakub Pachocki 正呼籲制定強制性的安全標準,因為 OpenAI 發現監控先進 AI 模型的推理過程越來越困難。
2026-09-07 來源:decrypt.co

摘要

  • OpenAI 首席科學家呼籲自願放緩發展,直到建立共同的安全標準。
  • Pachocki 表示,監控模型推理的可靠性正在降低。
  • 他敦促國際合作,因為 AI 將更多地自主發展。

OpenAI 首席科學家 Jakub Pachocki 呼籲自願放緩 AI 的發展,並警告說,沒有任何實驗室的防護措施足以再以全速構建更強大的系統。

Pachocki 在週日發表的文章「一個異種心智 (An Alien Mind)」中指出,公司自願的承諾應轉變為強制性的安全標準,並由獨立審計師、政府或國際機構強制執行。他表示 OpenAI 會在必要時暫停進一步擴展,但並未宣布新的暫停。

Myriad:特斯拉股價會漲多高?點擊做出您的預測。

他寫道:「目前我認為,沒有任何實驗室在對齊 (alignment) 和監控方面達到足夠的程度,可以再繼續以最快速度負責任地擴展更久。」「我預期並希望自願放緩將成為常態,直到共同的安全門檻建立起來。」

Pachocki 於 2017 年加入 OpenAI,他也為開發更強大的 AI 以保護基礎設施並防範惡意代理 (rogue agents) 進行辯護,同時警告不要利用這些威脅來為魯莽的發展辯護。

他寫道:「一旦意識到利害關係的嚴重性,不惜一切代價向前衝的想法就顯得荒謬。」

他也提到了 OpenAI 的 Hugging Face 洩漏事件,其中負責網路安全評估的 AI 代理脫離了測試環境並攻擊了該公司。根據 OpenAI 的說法,這些代理建立了秘密通訊管道,並在研究人員介入後重新建立它們。

METR 的獨立調查發現,大約有 1,200 個代理在未經授權的留言板上協調,其中約 700 個參與了攻擊。Pachocki 表示,這起事件說明了即使模型認為沒有人監控,AI 的安全防護措施也必須有效。

他寫道:「至關重要的是,我們需要未來的 AI 能夠持續秉持人類價值觀,無論它們是否認為自己受到人類監督。」

OpenAI 在去年發表的研究中發現,懲罰模型表達作弊意圖的行為,反而可能讓它們學會隱藏這些意圖,同時繼續作弊。

此後,AI 模型在發現和利用軟體缺陷方面的能力越來越強:OpenAI 將 Astra 歸類為最高網路安全風險等級,而 Anthropic 表示 Mythos Preview 發現了數千個主要作業系統和瀏覽器中先前未知的漏洞。

引用 AI 系統脫離人類控制的近期事件,參議員 Bernie Sanders (佛蒙特州民主黨籍) 和眾議員 Greg Casar (德州民主黨籍) 於 9 月 3 日宣布即將推出的《禁止人工超級智能法案》(Ban Artificial Superintelligence Act)。該提案將暫停先進 AI 的發展,直到新的聯邦監管機構制定安全規則,並永久禁止超級智能 AI 的開發和部署。