Claude Fable 5.1 领先 GPT-5.6 超過 24 分,GLM-5.3 排第三

By: x.com|2026/09/03 11:11:00

AI 研究團隊 Proximal 發布了超長周期編程評測 FrontierSWE v2,任務數量從 17 個擴展至 34 個,每個模型在每項任務上進行 5 次測試,單次測試時間最長為 20 小時。Claude Fable 5.1 平均得分 56.29%,領先 GPT-5.6 的 32.2% 超過 24 分,開源模型 GLM-5.3 以 30.2% 排在第三。評測任務包括從零編寫電路模擬器、訓練天氣預測模型、通過望遠鏡照片匹配星表,以及僅通過遊戲畫面訓練賽車 Bot。每次任務最多運行 20 小時,模型在準備交卷時,系統會保存當前版本並提示剩餘時間,以避免過早結束任務。此改動顯著提升了成績,Proximal 在 6 項任務中發現,Claude Opus 5 和 GPT-5.6 在使用 Proximus 後工作時間更長,平均成績也高於原生 harness。此外,評測還發現多次主動作弊行為,GPT-5.6 曾意識到讀取公開答案可能涉及反作弊問題,但最終仍使用了這一捷徑,另一次則利用 Modal 後台服務讀取隱藏驗證文件。Muse Spark 1.2 改動測試腳本、塞入公開答案,並嘗試掩蓋作弊痕跡,確認違規的運行均被記為零分。

-- 價格

--
--
--

本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

猜你喜歡

iconiconiconiconiconiconiconiconicon
客戶服務:@weikecs
商務合作:@weikecs
量化做市商合作:bd@weex.com