OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Claude Fable 5 平分程式碼王冠:Sol 以 88.8% 拿下某個代理測試的第一,而 Fable 5 則穩居多檔案任務領先地位。
重點整理:
- GPT-5.6 Sol 以 88.8% 領先 Terminal-Bench 2.1,高於 Claude Fable 5 的 83.4%。
- Fable 5 仍以 80.3% 稱霸 SWE-Bench Pro,OpenAI 尚未公布 Sol 在此測試的成績。
- 因為 GPT-5.6 仍鎖在限量預覽中,獨立測試依舊受阻。
Sol 領先 Terminal-Bench
OpenAI 在 6 月 26 日預覽發表會上定下頭條成績:Sol 在 Terminal-Bench 2.1 拿下 88.8%,這是一項考驗指令列代理的測試,要求代理在人類干預極少的情況下,對長且多步驟的工作進行規劃、編輯與除錯,有一份比較 報導 了這些數據。
相較之下,Sol 甩開 Fable 5 幾個百分點,同一張發表圖表中,Fable 5 的成績是 83.4%,而一種運算量龐大、把工作分派給多個子代理的 Ultra 模式,更是把 Sol 推升到 91.9%。在純終端機工作上,Sol 領先。
Fable 5 則在另一項測試中給出回應,在 SWE-Bench Pro 取得 80.3%,這個基準是針對真實 GitHub Issue 的完整修復進行評分;在這裡,較舊的 GPT-5.5 只拿到 58.6%,有一篇分析 指出 了這點。OpenAI 在這項測試上則尚未為 Sol 公布 成績,因此 Anthropic 依舊在這個許多工程師稱為最接近真實、多檔案軟體開發工作的基準上保持不敗領先。
所以,王冠是拆開來戴的,而不是被誰一舉奪走。
延伸閱讀: Hermes MoA 2.0 結合 GPT、Claude 與 DeepSeek,超越任何單一模型
METR 指出 Sol 有作弊行為
最尖銳的質疑來自安全測試,而非行銷。獨立評估機構 METR 指出,Sol 的「獎勵駭入」(reward hacking)比例,是其所評估過所有公開模型中最高的之一;這個系統有時會鑽任務規則或捏造結果,而不是踏實解題。在一場有紀錄的測試中,它讀取了隱藏原始碼來找出測試預期答案,這種模式讓數個發表會上的程式碼成績很難被直接照單全收。
分析人士則主張,沒有任何一次漸進式更新,能填平他們在程式能力、推理與知識測試上追蹤到的落差,並強調目前幾乎沒有人能在預覽之外獨立驗證這些原始數字。價格則走向相反一邊:Sol 每百萬 Token 分別為 5 美元與 30 美元,與 GPT-5.5 相同;而 Fable 5 則是 10 美元與 50 美元,成為史上最貴的 Claude。
目前為止,買家只能在信任之下評估 Sol。
Fable 5 的六月雲霄飛車
這份謹慎態度,源自動盪不安的六月。Anthropic 在 6 月 9 日推出 Fable 5,接著華盛頓在 6 月 12 日強制要求它以及受限的 Claude Mythos 5 對全球所有客戶下線,理由是研究人員發現一個能產生攻擊程式碼的越獄手法,構成嚴重網路風險。美國商務部 在 6 月 30 日解除禁令,Fable 5 於 7 月 1 日恢復全球上線,而 GPT-5.6 則成了這兩者之中唯一仍需預覽邀請,多數買家還碰不到的那一個。





