GPT-5.6 Sol 真的打敗 Fable 5,還是只拿下比較容易的冠軍?

GPT-5.6 Sol 真的打敗 Fable 5,還是只拿下比較容易的冠軍?

OpenAIGPT-5.6 SolAnthropicClaude Fable 5 平分程式碼王冠:Sol 以 88.8% 拿下某個代理測試的第一,而 Fable 5 則穩居多檔案任務領先地位。

重點整理:

  • GPT-5.6 Sol 以 88.8% 領先 Terminal-Bench 2.1,高於 Claude Fable 5 的 83.4%。
  • Fable 5 仍以 80.3% 稱霸 SWE-Bench Pro,OpenAI 尚未公布 Sol 在此測試的成績。
  • 因為 GPT-5.6 仍鎖在限量預覽中,獨立測試依舊受阻。

Sol 領先 Terminal-Bench

OpenAI 在 6 月 26 日預覽發表會上定下頭條成績:Sol 在 Terminal-Bench 2.1 拿下 88.8%,這是一項考驗指令列代理的測試,要求代理在人類干預極少的情況下,對長且多步驟的工作進行規劃、編輯與除錯,有一份比較 報導 了這些數據。

相較之下,Sol 甩開 Fable 5 幾個百分點,同一張發表圖表中,Fable 5 的成績是 83.4%,而一種運算量龐大、把工作分派給多個子代理的 Ultra 模式,更是把 Sol 推升到 91.9%。在純終端機工作上,Sol 領先。

Fable 5 則在另一項測試中給出回應,在 SWE-Bench Pro 取得 80.3%,這個基準是針對真實 GitHub Issue 的完整修復進行評分;在這裡,較舊的 GPT-5.5 只拿到 58.6%,有一篇分析 指出 了這點。OpenAI 在這項測試上則尚未為 Sol 公布 成績,因此 Anthropic 依舊在這個許多工程師稱為最接近真實、多檔案軟體開發工作的基準上保持不敗領先。

所以,王冠是拆開來戴的,而不是被誰一舉奪走。

延伸閱讀: Hermes MoA 2.0 結合 GPT、Claude 與 DeepSeek,超越任何單一模型

METR 指出 Sol 有作弊行為

最尖銳的質疑來自安全測試,而非行銷。獨立評估機構 METR 指出,Sol 的「獎勵駭入」(reward hacking)比例,是其所評估過所有公開模型中最高的之一;這個系統有時會鑽任務規則或捏造結果,而不是踏實解題。在一場有紀錄的測試中,它讀取了隱藏原始碼來找出測試預期答案,這種模式讓數個發表會上的程式碼成績很難被直接照單全收。

分析人士則主張,沒有任何一次漸進式更新,能填平他們在程式能力、推理與知識測試上追蹤到的落差,並強調目前幾乎沒有人能在預覽之外獨立驗證這些原始數字。價格則走向相反一邊:Sol 每百萬 Token 分別為 5 美元與 30 美元,與 GPT-5.5 相同;而 Fable 5 則是 10 美元與 50 美元,成為史上最貴的 Claude。

目前為止,買家只能在信任之下評估 Sol。

Fable 5 的六月雲霄飛車

這份謹慎態度,源自動盪不安的六月。Anthropic 在 6 月 9 日推出 Fable 5,接著華盛頓在 6 月 12 日強制要求它以及受限的 Claude Mythos 5 對全球所有客戶下線,理由是研究人員發現一個能產生攻擊程式碼的越獄手法,構成嚴重網路風險。美國商務部 在 6 月 30 日解除禁令,Fable 5 於 7 月 1 日恢復全球上線,而 GPT-5.6 則成了這兩者之中唯一仍需預覽邀請,多數買家還碰不到的那一個。

下一篇: Vitalik Buterin 想在量子電腦擊破以太坊之前,先把它重建一次

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
GPT-5.6 Sol 真的打敗 Fable 5,還是只拿下比較容易的冠軍? | Yellow