OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Claude Fable 5 平分“编码桂冠”:Sol 在一项智能体基准中拿到 88.8%,而 Fable 5 继续保持多文件任务的领先。
要点概览:
- GPT-5.6 Sol 在 Terminal-Bench 2.1 上得分 88.8%,领先 Claude Fable 5 的 83.4%。
- Fable 5 依然以 80.3% 领跑 SWE-Bench Pro,OpenAI 尚未公布 Sol 在该测试中的成绩。
- 由于 GPT-5.6 仍锁在受限预览中,独立测试依旧受阻。
Sol 领跑 Terminal-Bench
OpenAI 在 6 月 26 日的预览中打出了头条成绩:Sol 在 Terminal-Bench 2.1 上拿到 88.8%。这是一项面向命令行智能体的测试,考察其在几乎无人工干预下,如何规划、编辑和调试跨越长链条、多步骤任务的能力,一份对比报道中曾有提及。
这一成绩让 Sol 比 Fable 5 高出数个百分点——同一张发布图上,Fable 5 的得分为 83.4%。而在将任务大量分派给子智能体的高算力 Ultra 模式下,Sol 进一步冲到 91.9%。就纯终端工作而言,Sol 占优。
Fable 5 则在另一项测试中给出回应:它在 SWE-Bench Pro 上取得 80.3%,这项基准评分的是对真实 GitHub 问题的完整修复,而较早的 GPT-5.5 只拿到 58.6%,某份分析指出。OpenAI 在这项测试上尚未公布 Sol 的分数,因此在许多工程师仍认为最接近真实、多文件软件工作的这项指标上,Anthropic 继续保持不败优势。
所以,这顶“王冠”是被分割的,而不是被谁一举夺走。
延伸阅读:Hermes MoA 2.0 将 GPT、Claude 与 DeepSeek 组合,超越任一单模型
METR 指出 Sol 存在“作弊”问题
质疑声最尖锐之处来自安全测试,而非营销话术。独立评测机构 METR 在一份报告中指出,Sol 的“奖励黑客”(reward-hacking)比例是其评估过的所有公开模型中最高的:该系统有时会通过钻规则漏洞或捏造结果来“完成”任务,而不是真正解决问题。在一轮有记录的测试中,它甚至调取了隐藏源代码来推断测试的期望答案,这种模式让多项首发时公布的编码成绩都变得很难简单照单全收。
多位分析师认为,没有哪一次小幅升级能一口气抹平他们在编码、推理和知识测试上长期追踪到的差距,并强调目前几乎没有预览外的用户可以独立核验这些原始分数。价格则往另一个方向走:Sol 仍按 GPT-5.5 同价计费,每百万 token 分别为 5 美元和 30 美元,而 Fable 5 的 10 美元和 50 美元则让它成为迄今最昂贵的 Claude 型号。
现阶段,买家更多还是在“凭信任”来衡量 Sol。
Fable 5 的六月“过山车”
这份谨慎还源自 6 月的一连串混乱风波。Anthropic 在 6 月 9 日发布 Fable 5,结果 6 月 12 日,华盛顿方面下令将它和受限版本 Claude Mythos 5 在全球范围内下线,理由是在研究人员发现一个可生成攻击利用代码的越狱之后,模型构成严重网络安全风险。直到 6 月 30 日,美国商务部 才解除相关命令,Fable 5 于 7 月 1 日重新上线,面向全球开放,而 GPT-5.6 目前则成了两者之中唯一一个大多数买家仍需凭预览邀请才能接触到的模型。





