首頁LBank 新聞中心
這些研究人員剛剛縮小了一個 AI 模型,卻不知怎地讓它更聰明了
researchers-shrink-ai-model-made-smarter
這些研究人員剛剛縮小了一個 AI 模型,卻不知怎地讓它更聰明了
較小、較便宜的 AI 通常也代表更笨。但一項新技術顛覆了這個觀念——而你的手機可能會是贏家。
2026-08-25 來源:decrypt.co

簡要

  • Multiverse Computing 團隊於 8 月 25 日在 Hugging Face 網誌上發表了一種名為「量化感知修復 (Quantization-Aware Healing)」的方法。
  • 他們將 OpenAI 的開源 GPT-OSS 模型從 1,200 億個參數縮小到 600 億個,並將其記憶體壓縮到 4 位元——而這個縮小版模型在 9 項測試中有 7 項擊敗了它所複製的全品質模型。
  • 訣竅:讓縮小後的模型向原始的智慧版本學習,而不是向不完善的中間副本學習。

>>>> gd2md-html alert: inline image link in generated source and store images to your server. NOTE: Images in exported zip file from Google Docs may not appear in the same order as they do in your doc. Please check the images!

----->

一個研究團隊最近開發出一個更小、更便宜的大型 AI 模型版本。這個較小的模型結果比它所縮小的版本更聰明。

這本不該發生。

這就像是同時減去肌肉又變得更強壯。但 Multiverse Computing 的一個團隊表示他們做到了,而原因則揭示了我們以往縮小 AI 模型的方式可能都錯了。

Myriad: OpenAI 何時會發布 GPT-6?點擊進行你的預測。

研究人員在週五發表的一篇論文中寫道:「對於從業者來說,實際的訊息是,在一個基於蒸餾的修復管道中,量化步驟並非要最小化的成本,而是一個額外的教師監督機會,它能產生一個在服務上更便宜、記憶體佔用更少,並且至少與其全精度版本一樣精確的模型。」

你可以將 AI 模型中的參數想像成一堵巨大的旋鈕牆——這些數字承載著它所學到的一切。旋鈕越多,模型越聰明,但運行起來也越笨重。OpenAI 的 GPT-OSS 120B 擁有 1,200 億個這樣的旋鈕。每一個旋鈕都消耗記憶體和電力。

為了降低 AI 的運行成本,公司會精簡參數並縮小剩餘的部分。這就像壓縮照片一樣:檔案變小了,但過度壓縮會導致圖像模糊(就像從 4K 變成 720p)。過度縮小模型會使其變笨。所有人都接受了這種權衡。

這些研究人員更進一步。他們將 GPT-OSS 模型削減到 600 億個參數,並將每個參數壓縮到一個微小的 4 位元插槽中——這相當於極致的數位壓縮。通常這會嚴重損害模型的性能,但這些研究人員找到了一種方法來實際增強它。

在幾乎所有用於比較的基準測試中,這個較小的模型都超越了使用全精度構建的模型。

影印錯誤

當你縮小模型時,通常會透過與「半縮小」版本(即擁有 600 億個參數且精度較高的版本)進行比較來修正其錯誤。問題在於,這個中間模型本身就已經是原始模型的模糊副本。因此,你是在教導這個小型模型去模仿一個有缺陷的雙胞胎。它永遠無法超越這個雙胞胎。

這些研究人員所稱的「量化感知修復 (Quantization-Aware Healing)」改變了目標。它將小型模型指向未壓縮的原始大型模型,並指示:複製這個模型的答案。這個小型模型向大師學習,而不是從模糊的中間版本學習。在 9 項測試中,這個 4 位元、600 億參數的模型在 7 項中擊敗了本應是其「優勢對手」的 600 億參數模型。真正的 1,200 億參數模型仍然在大多數回合中獲勝——模型的規模並未被完全取代——但這個「精簡版」模型跨越了一個此前無人認為它能達到的門檻。

更小巧、更聰明意義重大,因為 AI 消耗硬體資源。這個修復後的模型大約只需要原始模型四分之一的記憶體和一半的參數。這就是一個需要數據中心運行的 AI 與一個適合普通桌面電腦——甚至最終能安裝在你的手機上——的 AI 之間的差距。

因此,一個能夠在消耗一半能源的同時產生更好結果的模型,對於小型實驗室和本地開發者來說意義重大。

它還是免費的。該團隊在 Hugging Face 上以開源權重 (open weights) 的形式發布了修復後的 Hypernova-60B 模型,因此任何人都可以下載並運行它。這符合一連串開源模型突破驚人障礙的趨勢:一個神秘的免費模型 Ox Alpha 最近擊敗了背後沒有已知開發者的 Claude 系統、阿里巴巴 Qwen 3.8 Flash Next 的熱潮,以及利用來自 Fable 或 Claude Opus 等更大語言模型的推理軌跡來改進小型模型的微調浪潮。

不過,不要過度解讀。產生這個 600 億參數學生模型的縮小工具是專有的,所以其完整配方尚未完全開源,而且該團隊僅測試了 GPT-OSS 模型——而不是 Llama、Qwen 或 Mistral 系列模型。