Claude Opus 5 在大多數基準測試中超越 Fable 5,價格卻只有一半
Claude Opus 5 今天正式推出。對於企業來說,運行它的成本比 Anthropic 的主打模型 Claude Fable 5 更低,後者被該公司定位為付費用戶的日常前沿產品。更重要的是,Opus 5 在重要的基準測試中也超越了它。
要了解 Opus 5 的定位:Anthropic 的產品線分為四個層級。Haiku 是快速且便宜的,Sonnet 屬於中端,Opus 是重型工作馬。在其之上是 Mythos 類別——這是 Anthropic 在春季推出的一個層級——包括面向公眾的 Claude Fable 5,以及 Claude Mythos 5,這是一個通過 Project Glasswing 為經過審核的網絡安全研究人員和關鍵基礎設施運營商保留的版本,限制較少。
作為訂閱用戶的旗艦產品,Fable 5 的表現不佳。它於 6 月 9 日推出,三天後因美國政府發布緊急出口管制令,指出存在越獄漏洞而被全球撤回,並於 6 月 30 日重新上線——卻立即轉為僅限於信用的模式,不再包含在標準計劃中。Opus 5 現在填補了 Fable 5 無法保持的空缺。
擁有數百萬用戶的開發者平台 Lovable 在其內部評估中運行了 Opus 5,並指出其增益超越了原始分數:"它不僅在我們最困難的代理編碼任務上表現更好,比 Opus 4.7 提高了 22%,而且穩定性更高,運行之間的變異性大大減少,"Fabian Hedin 在 Anthropic 分享的聲明中表示。
基準測試
聽起來可能有些奇怪,但 Opus 在幾乎所有對日常用戶重要的方面都超越了 Fable,而不被標記為 Mythos 類別。
在 Frontier-Bench v0.1——一個測試 AI 編碼代理是否能夠完成端到端真實軟件工程任務的基準,按通過的任務百分比計分——Opus 5 的得分為 43.3%。Fable 5 的得分為 33.7%。OpenAI 的 GPT-5.6 Sol,Anthropic 的主要商業競爭對手,得分為 34.4%。
最顯著的差距出現在 ARC-AGI-3,這是一個基於模型無法從訓練數據中記憶的全新謎題進行的真正問題解決測試,按解決的謎題百分比計分。Opus 5 的得分為 30.2%;GPT-5.6 Sol 的得分為 7.8%;而 Fable 5 根本沒有進行測試。在 GDPval-AA v2——一個通過 Elo 評級計分的知識工作基準,這是一種用於測量真實專業任務相對表現的棋類排名系統——Opus 5 的得分為 1,861,而 Fable 5 的得分為 1,747,GPT-5.6 Sol 的得分為 1,736。
Zapier 在 AutomationBench 上測試了 Opus 5,這是一個評估模型是否能夠在沒有人工幫助的情況下從頭到尾執行完整業務工作流程的評估。他們的判斷是:該模型"從一個原始的帳戶健康工作簿中運行了一個完整的客戶流失預防序列:標記高風險帳戶,提醒正確的擁有者,並為保留操作進行總結。之前的模型未能通過;Opus 5 則達到了 100%。"
Anthropic 也將 Opus 5 作為研究升級進行推廣。DNA 測序公司 Ultima Genomics 表示,該模型"的表現更像是一位謹慎的科學家,而不是我們運行過的任何模型。它會尋找正確的統計測試來排除混淆因素,通過獨立方法交叉檢查自己的結果,並在長時間的多步分析中保持正確的方向。"
不過,這兩個領域——法律和健康——是 Fable 5 僅僅在微小的範圍內表現優異的唯一領域。
此次發布距離 Moonshot AI 的發布僅一周,這是一家由阿里巴巴支持的北京初創公司,推出了 Kimi K3——一個擁有 2.8 兆參數的開放權重模型(意味著任何人都可以下載底層代碼以獨立運行),Moonshot 將其描述為世界上最大的開放 AI 系統。獨立基準測試一致將 Kimi K3 排名第三,僅次於 Fable 5 和 GPT-5.6 Sol,在特定領域超越這兩者。
Opus 5 現在通過 API 提供,每百萬個輸入標記的價格為 5 美元,每百萬個輸出標記的價格為 25 美元。(標記是 AI 模型在輸入和輸出中可以處理的基本信息單位)。還提供一種快速模式,運行速度約為默認速度的 2.5 倍,價格為基礎價格的兩倍——每百萬個輸入標記 10 美元,每百萬個輸出標記 50 美元。
此次發布可能結束了對 Fable 5 缺乏公共可用性的焦慮。Opus 現在也可供所有人訂閱使用。
-- 價格
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。
猜你喜歡

從 Web3 到 AI:這群人為什麼總能踩中下一個風口

前DeepMind科學家曹原稱AI獨立獲諾獎需二三十年

哈薩比斯退場,前LLM時代最後一幕

DeepMind換帥,Google Cloud為何可能成為最大贏家?

谷歌AI高層巨變:AGI深水區與日常模型肉搏的物理切割

昨夜今晨重要資訊(8月3日-8月4日)

Google DeepMind高管稱AI投資押注遞歸自我改進

DeepSeek把AI應用創業者的春天帶來了
25歲AI股神也虧麻?Situational Awareness尋求新資金注入,創始人呼籲投資者「抓住買入機會」

亞馬遜重做 AI,停止 Nova 旗艦模型升級

高通、Arm齊跌:內存漲價的帳單,終於寄到手機晶片公司了

Arm 第一財季營收 12.9 億美元同比增 22% 超預期

Altman 复盤 OpenAI 最艱難一年

亞馬遜調整 AI 策略,淘汰大多數 Nova 模型,聚焦前沿研發

亞馬遜 AGI 部門裁員,1 月裁減 1.6 萬人後再調整

梁文鋒四小時投資人會議實錄

梁文鋒稱 DeepSeek 目標為 AGI 非超級 App

GPT-6 內測近兩月,能力疑似逼近 AGI

WAIC 觀察:擁擠的共識,巨大的泡沫

解讀智譜AI內部信:巨浪已至,上市後不搞變現搞科研,押注最「燒錢」的AGI孤徑

Delphi Ventures未來十年預測:AI/自動化、全球多極化、人口老齡化正重塑世界
智譜繼續聚焦 AGI 研究,啟動 Touch High 計畫

MiniMax創始人閻俊杰停止領取薪酬,拿出5%股份用於團隊激勵和開源支持

質疑 DeepSeek 面試的華為天才少年,身陷 Web3 投資人「炮轟」中

Sentient 基金會宣布投入 4,200 萬美元,推進開源通用人工智慧資助與投資

潮汐投資:AI 產業鏈我們仍然看好,但理由變了

IBM CEO 質疑行業 AGI 巨額投資:資本支出畸高難以實現回報

DeepSeek 融資故事

B.AI 使用者突破 180 萬,加速邁向 AGI




