Anthropic 周一正式推出 Claude Sonnet 5.5,表示這款全新中階 AI 模型推理速度較前一代提升逾 30%,單次任務成本最高可節省約 30%。
重點整理:
- Sonnet 5.5 在 Terminal-Bench 4.0 程式測試中拿下 70.6%,遠高於 Sonnet 5 的 10.3%。
- 這是首款內建旗艦級網路資安防護機制的 Sonnet 系列模型。
- 一項獨立基準測試指出,在「最大運算強度」情境下,Sonnet 5.5 單任務實際成本反而高於 Sonnet 5。
Claude Sonnet 5.5 效能與基準測試
這是 Claude 5.5 系列中第二款上市的機型,距旗艦級 Claude Opus 5.5 上線僅相隔六天,Anthropic 在發表聲明中表示,Sonnet 5.5 被定位為 Opus 5.5 的「更快、更省」搭檔。
官方將 Sonnet 5.5 鎖定於「定義清楚的日常任務」,例如除錯修 bug、撰寫與潤飾文件、簡報與試算表等,收費為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元。
在代理式程式測試 Terminal-Bench 4.0 中,Sonnet 5.5 的成績為 70.6%,明顯優於 Sonnet 5 的 10.3%,也略高於價格更昂貴的 Opus 5.5 的 66.4%。Sonnet 5.5 亦成為首款僅依賴畫面截圖就成功通關《寶可夢 紅》的 Sonnet 模型,被視為其長程任務規劃與圖片理解能力的驗證。
目前該模型已全面開放,可在 Amazon Web Services、Google Cloud 與 Microsoft Azure 等主要雲端平台上使用。Anthropic 表示,鎖定高流量、極度價格敏感應用場景的更小型模型 Claude Haiku 5.5,將在未來數週內接續推出,補齊 5.5 世代的三機型產品線。
延伸閱讀: OpenAI After Sept. 20 Sandbox Escape
Sonnet 5.5 資安機制與實際成本
Anthropic 在聲明中引用 Epic Games 營運長 Daniel Vogel 的說法,指出 Sonnet 5.5 在早期測試階段,已能處理「數萬行遊戲系統程式碼」。Vogel 表示,其輸出品質「達到你對高階模型所期待的水準」。
由於 Sonnet 5.5 的網路與資安相關能力已接近前一代旗艦 Opus 5,這次也是首次在 Sonnet 系列上,直接開啟原本僅限最高階模型的資安防護機制。Anthropic 強調,一般除錯與維護不受影響,但風險較高的網路攻防類請求,系統會明顯降級改由 Sonnet 5 處理;新的分類器亦會攔阻試圖抽取模型「推理過程」的請求。
然而,並非所有測試都支持成本下降的官方說法。獨立研究機構 Artificial Analysis 的測試顯示,在「最大努力」的設定下,Sonnet 5.5 每個基準任務的加權成本約為 7.60 美元,高於 Sonnet 5 的 5.09 美元;不過其綜合指數分數,也從 Sonnet 5 的 38 升至 56,代表效能明顯提升。
Sonnet 5.5 的登場緊接在 9 月 22 日 Opus 5.5 發表之後,Anthropic 當時宣布將旗艦模型價格下調 20%,至每百萬輸入 token 4 美元、每百萬輸出 token 20 美元,並稱在一般實務工作負載下,Opus 5.5 的實際使用成本可較前代 Opus 5 減少約四成,輸出速度則加快逾三成。同日,OpenAI 也推出 GPT-6 Sol 與 GPT-6 Luna,定價為前一代的一半,點燃新一輪 AI 模型價格與效能競賽。
下一篇: BlackRock Says Computing Power Is Headed For Futures Markets

