克勞德代碼在28個比較中超越17個代碼夥伴
By: www.tokenpost.kr|2026/08/11 09:28:01
0
分享
在騰訊的AI編碼代理基準測試中,安索普提克的克勞德代碼在28個模型比較中超過了17個代碼夥伴。在代碼領域中,所有7個模型在使用克勞德代碼執行時得分較高。騰訊的YouTube實驗室、Kin Security Lab、Windy Security Lab和WorkBuddy公開了由260個任務組成的WorkBuddy基準。這些任務分為80個代碼、70個網頁、50個辦公室和60個安全任務。Harnis是一個負責管理上下文、調用工具和執行任務的代理執行層。評估結果顯示,在網頁和辦公室領域中,代碼夥伴分別以4比3領先,而在安全領域中,克勞德代碼則以4比3佔優。GLM-5.2的網頁得分分別為67.43和60.71,GPT-5.5的安全得分為77.91和64.39。排行榜固定為代碼夥伴2.109.3和克勞德代碼2.1.187,每個得分是think模式下執行三次的平均值。此次結果顯示,在評估AI編碼工具時,執行結構和工具控制方式也應考慮。然而,評估任務在各領域限制為50至80個,BlockBits提出額外問題可能會改變排名。WorkBuddy基準將通過公開存儲庫和Hugging Face數據集提供。
-- 價格
--
--
--
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。
猜你喜歡

Hermes Bot Mode 正式內置,支持 AI 群組協作

人工智慧競賽:美國要求選擇立場 - 法國Mistral轉向中國

GPT-5.6,工作成本降低三分之一
OpenAI 和 Anthropic 之間最新 AI 模型的成本競爭正在從每個標記的價格轉向每次工作的總成本比較。中國 AI 模型在公開價格表中...

ZCode 免費送 1 億 GLM-5.3 Token 活動上線一小時暫停

web3: Z.ai發布GLM-5.3程式模型瞄準開源權重市場

比特幣紅隊在 Kimi K3 掃描後標記 7,958 個問題

智譜唐傑預告 GLM-5.3 上線在即

GPT-5.6 解決方案,總成本比 K3 低 13%
中國人工智慧(AI)模型在實際業務成本比較中,與美國模型的成本觀念受到挑戰。雖然中國模型的標記單價較低,但在回答生成中使用的標記數量和質量也影響了成本。

Writer發布新模型Palmyra X6主打降本

Mistral 開始托管智譜 GLM-5.2 模型

智譜ZCode升級,Goal+子Agent功能上線

智譜用戶接近700萬,啟用超5萬塊國產AI芯片

GLM-5.2 價格暴跌 95%,威脅 DeepSeek 進入 AI 價格戰
Zhipu 將其 GLM-5.2 模型的價格降低了 95%,使其比 DeepSeek V4 Flash 更便宜,並引發了與代理平台的價格戰。第三方如 OpenRouter 和 StreamLake 現在以每百萬個代幣 $0.07 的入場價和 $0.22 的出場價提供代幣,而官方價格為 $1.4 和 $4.4。這一消息在社交媒體上迅速傳播,並引發了緊急警報以利用折扣。

比特幣的 AI 安全行動在 55 小時內發現 6,700 個問題,但沒有人知道有多少是真實的
比特幣紅隊在 55 小時內生成了 6,700 個發現,顯示 AI 如何迅速向安全團隊提供需要驗證和修復的問題。

Pally 完成 520 萬美元融資,Cyber Fund 和 Y Combinator 領投

AMD推出企業級AI編程平台AMD Instinct Coder

OpenRouter 周榜中國模型占八席












