
Anthropic 於週二發布了 Claude Fable 5.1 和 Claude Mythos 5.1,這是自 Fable 5 於 6 月 9 日推出以來,其 Mythos 級模型系列首次更新。
該公司聲稱,這些新的人工智慧模型是世界上「用於編碼和知識工作的最先進模型」。這次發布距離其啟動週期已達三個月,期間已歷經 18 天的出口管制停擺、夏季中旬的訂閱存取權價格戰,以及 7 月發布的 Claude Opus 5 在價格上擊敗 Fable 5 的事件。
根據 Anthropic 的說法,Fable 5.1 和 Mythos 5.1 是底層相同但加裝不同安全過濾器的模型。Fable 5.1 對所有擁有 Claude 帳戶的用戶普遍可用。Mythos 5.1 則仍僅限 Anthropic 的網路安全驗證計畫(Cyber Verification Program)和生命科學驗證計畫(Life Sciences Verification Program)中,經審查的網路安全和生命科學專業人士使用,這些計畫是限制 Mythos 5 存取權的 Project Glasswing 的後繼者。
基準測試實際測量了什麼
Anthropic 的主要數據來自 Terminal-Bench-Science 0.1,這是一個測試 AI 代理是否能在命令列環境中執行科學研究任務的基準測試,以通過率計分。
Fable 5.1 獲得 52.6% 的分數,而 Fable 5 為 24.7%,Opus 5 為 29.0%,比其前身高出一倍以上。
Terminal-Bench 4.0 測試的是透過終端機進行的代理式編碼——在多步驟命令列會話中編寫、運行和調試程式碼,以正確完成任務的百分比計分。Fable 5.1 獲得 55.8% 的分數,高於 Fable 5 的 42.0%,並領先 Opus 5 的 52.3%。
Mythos 5.1 在運行較輕的網路安全過濾器時,在相同的測試中獲得 60.9% 的分數;Anthropic 表示,這一差距反映了其安全措施攔截並重新路由到 Opus 4.8 的任務。
在「人類最後的考試」(Humanity's Last Exam)這項多學科推理測試中,Fable 5.1 在未使用外部工具的情況下達到 60.9% 的通過率,使用外部工具後達到 65.0%,兩者均優於 Opus 5,顯示這是 Anthropic 用於學術目的最先進模型。
它在哪方面超越了 Opus 5,以及其中模糊不清的計算
Opus 5 於 7 月發布,其每 token 價格僅為 Fable 5 的一半,但在大多數主要基準測試中都超越了 Fable 5,這實際上使得旗艦模型對大多數付費用戶而言顯得多餘。
Fable 5.1 扭轉了局面:它現在在 Anthropic 發布的所有基準測試中都超越了 Opus 5,包括 Opus 5 之前擊敗 Fable 5 的那些測試。
但 Fable 5.1 的每 token 價格仍然是 Opus 5 的兩倍——輸入 10 美元、輸出 50 美元,相較於 Opus 5 的輸入 5 美元、輸出 25 美元。Tokens 是模型能處理的基本資訊量(通常約為平均一個英文單字的三分之二),公司需要為使用付費,因為繁重的工作流程通常會很快耗盡訂閱方案中的配額。
Anthropic 自己的模型宣傳側重於努力程度而非原始分數:它表示以低或中等推理努力運行 Fable 5.1,其結果能與 Fable 5 的舊結果相符或超越,且成本更低,同時將頂級努力層級保留給其他所有模型都束手無策的問題。
對於例行工作而言,努力程度越低,完全跳過 Opus 5 的論點就越薄弱。
存取權限遵循與 Fable 5 相同的劃分方式, Anthropic 在數月後調整了條款。在 Pro 方案和標準團隊或企業席位中,Fable 5.1 完全來自按 API 費率計費的按使用量計費的使用點數,因為它不屬於這些方案的每週限額。在 Max 方案和進階團隊或企業席位中,Fable 5.1 作為訂閱的標準部分包含在內,使用量最高可達每週限額的 50%。
Claude Fable 5.1 現已在 Claude API、Amazon Bedrock、Google Cloud 和 Microsoft Foundry 上提供,模型 ID 為 "claude-fable-5-1"。