Anthropic 周一发布新一代中端大模型 Claude Sonnet 5.5,称其在典型任务上的推理速度较上一代提升逾 30%, 单次任务成本最高可再压缩约 30%。
要点速览:
- 在 Terminal-Bench 4.0 代码代理测试中,Sonnet 5.5 得分 70.6%,远高于 Sonnet 5 的 10.3%。
- 首次将此前仅限旗舰系统使用的网络安全防护机制下放到 Sonnet 系列。
- 有独立基准测试称,在“最大强度”设置下,其单任务实际成本反而高于 Sonnet 5。
Claude Sonnet 5.5 性能指标
这是 Claude 5.5 产品线中的第二款模型,距离旗舰 Claude Opus 5.5 发布仅过去六天, Anthropic 在发布公告中表示。
官方将 Sonnet 5.5 定位为 Opus 5.5 的“加速与降本”型搭档,重点面向需求边界清晰的日常任务: 例如常规代码改错、文档润色、幻灯片与表格制作等。定价为每百万输入 Token 2 美元、 每百万输出 Token 10 美元。
在代理式代码评测 Terminal-Bench 4.0 中,Sonnet 5.5 的得分 为 70.6%,相比之下 Sonnet 5 为 10.3%,更高端的 Opus 5.5 为 66.4%。该模型还首次实现 仅凭截图“通关”《精灵宝可梦 红》,被视为其长周期规划和多模态理解能力的一项里程碑测试。
Sonnet 5.5 已在 Anthropic 全部平台上线, 包括 Amazon Web Services、Google Cloud 与 Microsoft Azure。 面向大规模、极致成本敏感场景的小型模型 Claude Haiku 5.5 将在数周内推出,届时公司新一代三档产品矩阵将基本补齐。
延伸阅读:OpenAI 在 9 月 20 日“沙盒逃逸”事件后放缓 Frontier AI 推进节奏
Sonnet 5.5 的安全护栏与成本争议
Anthropic 在发布中引用 Epic Games 首席运营官 Daniel Vogel 的评价。 他表示,在早期测试中,Sonnet 5.5 能处理数万行游戏系统代码,其输出“达到了通常只有更高档模型才能达到的质量标准”。
由于其网络攻防与运维相关能力已接近 Opus 5,Sonnet 5.5 成为首个在发布时就启用 Anthropic 最高等级网络安全防护的 Sonnet 型号。 官方强调,常规层面的 Bug 修复不受影响,但对于高风险网络安全请求,系统会显式回退至 Sonnet 5。 新引入的分类器同时会拦截用户试图“抽取模型推理链条”的行为。
不过,并非所有第三方评测都支持“更便宜”的说法。独立机构 Artificial Analysis 的测试 显示, 在“最大努力”(Max Effort)模式下,Sonnet 5.5 的加权后单任务成本约为 7.60 美元,而 Sonnet 5 为 5.09 美元, 尽管 Sonnet 5.5 的综合指数得分从 38 提升至 56。
Sonnet 5.5 的发布紧随 9 月 22 日 Opus 5.5 上市之后。当时 Anthropic 宣布将旗舰定价整体下调 20%,至每百万输入 Token 4 美元、每百万输出 Token 20 美元;并称在典型工作负载上, Opus 5.5 的整体使用成本较 Opus 5 降幅可达约 40%,输出速度则加快逾 30%。 同日,OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,两款新模型的定价为各自前代的一半。

