OpenAI 新一代 GPT-5.6 Sol 与 Anthropic 的 Claude Fable 5 正在基准测试中互有攻守,而 Fable 的折扣访问窗口将于 7 月 19 日截止。
要点概览
- OpenAI 推出 GPT-5.6 的三档产品 Sol、Terra 和 Luna,取代此前“一款模型通吃”的单一架构。
- 独立测试显示,Claude Fable 5 在创意写作和编码实测中略胜 GPT-5.6 Sol 一筹,而 Sol 在大部分标准化基准上领先。
- Anthropic 已三度延长 Fable 5 面向付费用户的免费/优惠访问期,目前截止日期锁定在 7 月 19 日。
Sol 价格与产品定位
据 报道,OpenAI 已于 7 月 9 日将 GPT-5.6 正式转为全面可用(GA),并拆分为三款独立模型,而非一套可调参数的统一系统:Sol 为旗舰档位,Terra 居中,Luna 面向轻量场景。
在定价上,Sol 的输入端按百万 token 收费 5 美元、输出端 30 美元,约为 Anthropic Fable 5 的“半价”——后者分别为 10 美元和 50 美元。更便宜的 Luna 定价仅为 1 美元和 6 美元,但在编码基准测试上的表现已压过 Claude Opus 4.8,这一数据随后也得到 OpenAI 证实。
与之形成对比的是,Fable 5 上线过程更显波折。一家评测机构梳理称,美国出口管制于 6 月 12 日将该模型在全球“紧急拉闸”,距离其最初设定的免费访问期结束日期仅差数日。
监管机构于 6 月 30 日解除限制。Anthropic 在 7 月 1 日恢复 Fable 5 服务,并将原本的促销价和宽松访问条款先后三度展期,最近一次延长至 7 月 19 日。
延伸阅读:底特律雄狮横扫 ESPN 天赋榜——预测市场看到的,与 ESPN 不一样?
测试结果:标准化 vs 真实体验
从标准化评测看,Sol 整体占上风:在 Artificial Analysis Coding Agent Index 指标上,Sol 得分 80 分,Fable 为 77.2 分;在另一项“Agents' Last Exam”基准上,Sol 的通过率为 53.6%,Fable 则为 40.5%。不过,在更综合的 Intelligence Index 上,Fable 5 则以 1 分的微弱优势反超 Sol。
实操测试给出的画面要更接近胶着。评测者在两款模型上投放完全相同的提示词(prompt),认为二者在创意写作和逻辑谜题上的表现大致“打成平手”,但各自偏科明显,呈现出不同风格的强项。
在部分编码任务里,Fable 5 则拉开了更清晰的差距。在一项“单轮出码”的浏览器小游戏开发测试中,Fable 5 直接交付了带音乐、动画和道具系统的完整版本,而 Sol 生成的版本则缺失这些元素。
自 6 月 9 日首发以来,Fable 5 的“可用性时间线”异常坎坷:模型先是承诺免费使用至 6 月 22 日,却在到期前因出口争议整体下线;7 月 1 日恢复后又被加上更严格的周度调用上限,其后付费墙生效日期先后两次被推后——从 7 月 12 日再延至如今的 7 月 19 日。





