Anthropic 周一發布最新中階大模型 Claude Sonnet 5.5,聲稱相較上代 Sonnet 5,推理速度提升逾三成,單次任務成本最多可節省約三成。
重點摘要:
- Sonnet 5.5 在 Terminal-Bench 4.0 編碼測試中取得 70.6% 成績,遠高於 Sonnet 5 的 10.3%。
- 成為首個配備原屬頂級模型網絡安全防護的 Sonnet 系列模型。
- 有獨立基準測試反指,在「極限模式」下,其單次任務實際成本高於 Sonnet 5。
Claude Sonnet 5.5 基準表現
Anthropic 在發布公告中指,Sonnet 5.5 是 Claude 5.5 系列中第二款型號,繼旗艦級 Claude Opus 5.5 推出僅六日後面世,詳情見公司公告。
官方將 Sonnet 5.5 定位為配合 Opus 5.5 使用的「快而抵」中階模型,主要針對界定清晰的日常任務、除錯工作,以及撰寫與潤飾文件、簡報與試算表等。收費為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元。
在代理式編碼基準測試 Terminal-Bench 4.0 中,Sonnet 5.5 的得分為 70.6%,明顯高於 Sonnet 5 的 10.3%,亦略勝定價更高的 Opus 5.5(66.4%)。該模型亦成功只靠截圖通關《精靈寶可夢 紅》,被視為其長期規劃能力及圖像理解能力的指標測試。
新模型現已登陸所有 Anthropic 支援平台,包括 Amazon Web Services、Google Cloud 及 Microsoft Azure。Anthropic 表示,主打高吞吐及極致成本敏感場景的更小型 Claude Haiku 5.5 將於數星期內推出,屆時形成 Opus/Sonnet/Haiku 的三檔產品組合。
延伸閱讀: OpenAI 在 9 月 20 日「沙盒逃逸」事件後暫緩 Frontier AI 進度
Sonnet 5.5 的安全防護與實際成本
Anthropic 在介紹中引用 Epic Games 營運總監 Daniel Vogel 的測試經驗。他表示,在早期試用中,Sonnet 5.5 能處理「數以萬行計」的遊戲系統程式碼,整體表現「達到一般會期望自高階模型身上的質素門檻」。
由於其網絡攻防與滲透相關能力已接近 Opus 5,Sonnet 5.5 亦成為首個在發布時,直接配備 Anthropic 以往只給最高階模型使用的網絡安全防護的 Sonnet 產品。官方稱這些防護不會影響日常除錯與一般開發工作,但對較高風險的網絡安全請求會明顯「降級」回 Sonnet 5。新加入的分類器亦會阻截外界嘗試抽取模型內部推理過程的行為。
不過,並非所有測試都認同其「更平」說法。獨立機構 Artificial Analysis 的測試 reportedly顯示,在設定為最高運算強度的情況下,Sonnet 5.5 每個基準任務的加權成本約為 7.60 美元,高於 Sonnet 5 的 5.09 美元。不過,在相同條件下,Sonnet 5.5 的整體指數分數由 38 提升至 56,代表質量及能力有明顯進步。
是次發布緊接 9 月 22 日 Opus 5.5 登場;當時 Anthropic 同時宣布將旗艦模型定價下調兩成,至每百萬輸入 token 4 美元、每百萬輸出 token 20 美元。公司當時預計,Opus 5.5 在一般工作負載下的實際成本將比 Opus 5 低約四成,同時輸出速度快逾三成。
同日,OpenAI 亦發布 GPT-6 Sol 與 GPT-6 Luna,並將其定價壓至各自前代的一半,令大型模型在企業及開發者市場上的性價比戰進一步升級。
下一篇: 貝萊德指運算力或步入期貨市場

