OpenAI 最新一代 GPT-5.6 系列 已正式公開發售,產品線清楚分成高階旗艦 Sol 同中價 Terra,兩款模型針對截然不同嘅使用場景同工作負載而設計。
重點摘要:
- Sol 每 100 萬個輸入 token 收費 5 美元、輸出 token 30 美元,約為 Terra 價錢嘅一倍。
- Sol 喺編碼同智能代理基準測試中領先,Terra 則以較低成本處理日常例行工作。
- 初步測試發現,長時間任務下 Terra 產生嘅輸出 token 有時多過 Sol,未必真係慳錢。
GPT-5.6:Sol 與 Terra 價錢結構愈拉愈闊
OpenAI 已於 7 月 9 日 正式宣佈,將 GPT-5.6 全線推送至 ChatGPT、Codex 同 API,用戶試用期約兩星期後正式結束。當中,旗艦版 Sol 主攻複雜編碼、網絡安全同長時間運行嘅智能代理工作,OpenAI 更形容 Sol 係迄今「最佳編碼模型」。Terra 則定位低一級,效能大致對標 GPT-5.5,但成本約為其一半。
真正將兩者拉開距離嘅係定價。Sol 每 100 萬個輸入 token 收 5 美元、輸出 token 收 30 美元;Terra 同一量級分別只收 2.5 及 15 美元。同系列第三款模型 Luna 進一步壓低至輸入 1 美元、輸出 6 美元,主攻高用量、成本敏感型場景。
喺 ChatGPT 裏面,分層同樣清晰。付費訂戶要揀中度或更高推理設定先會用到 Sol;免費同 Go 用戶,喺 ChatGPT Work 同 Codex 預設就係 Terra。GitHub 亦已經喺 Copilot 加入 三款模型:Sol 被包裝成適合處理大型代碼庫、高強度推理嘅選擇;Terra 則被定位為日常「代理式編碼」嘅平衡預設方案。
延伸閱讀:Charles Hoskinson 會唔會離開 Cardano?佢斥傳聞「完全係假」
編碼實測:Sol 跑分拋離 Terra
喺 Artificial Analysis Coding Agent Index 上,Sol 拿到 80 分,OpenAI 指出比 Anthropic 嘅 Claude Fable 5 高約 2.8 分。行政總裁 Sam Altman 亦曾表示,新模型喺編碼任務上 token 使用效率較上一代提升 54%,明顯係向企業 IT 預算開火。
不過,各項基準測試表現並非一面倒。以 SWE-Bench Pro 為例,Sol 的 64.6% 成績仍然落後 Claude Mythos 5 約 15 個百分點。但獨立評測機構嘅測試發現,Sol 面對冗長而凌亂嘅代碼庫時,仍能長時間保持專注同任務連貫性;Terra 則較適合範圍清晰嘅實作任務、第一輪代碼審查,而真正棘手嘅 case 再升級交俾 Sol 處理。
對尋求慳錢嘅團隊而言,同一批測試亦提出一個警號:Terra 喺長時間編碼任務中輸出 token 用量竟然多過 Sol。換言之,單睇牌價 Terra 雖然較平,但完工一單複雜任務嘅總帳可能並不更低。OpenAI 建議企業以「每個成功解決任務嘅實際成本」作衡量,再考慮將重度流量轉移到 Terra。
OpenAI 推前沿模型:更審慎、更分級
GPT-5.6 的分階發布,亦反映 OpenAI 對前沿模型出貨策略出現明顯轉向。
公司在發佈前,已先行向美國政府簡報整個系列嘅能力邊界,並將早期測試權限限制在一小批經審核嘅合作夥伴之間,同時向官方通報參與名單。
今代亦徹底改寫以往以「數字+小數點」標示型號嘅做法——「5.6」只代表技術世代,Sol、Terra 同 Luna 則被視為相對穩定嘅能力級別,可以各自按進度獨立升級,而毋須等到整個世代一齊更新。






