OpenAI 公布全新 Ultrafast 預覽服務級別,支援以 GPT-5.6 Sol 為核心的超高速推理,官方指其輸出速度較標準模式最高快 14 倍,每秒最多可產生約 750 個輸出 tokens。
重點摘要:
- Ultrafast 模式下,GPT-5.6 Sol 推理速度較標準處理最高提升約 14 倍。
- 模式由 Cerebras 提供算力支援,每秒可輸出高達約 750 個 tokens。
- 服務現階段屬限量預覽,OpenAI 表示會隨運算容量擴充逐步開放。
Ultrafast 限量預覽詳情
OpenAI 於 8 月 13 日公布 Ultrafast,並率先透過其 API 向小部分企業客戶開放,以高速為主打的新層級會隨容量增加而擴大覆蓋。
這項服務由 Cerebras 提供底層運算,按 OpenAI 描述,是專為 在維持 GPT-5.6 Sol 功能表現的前提下,大幅縮短回應生成時間而設計。所謂輸出 tokens,即模型生成文字的最小單位。OpenAI 指出,以往如要追求近乎即時的互動速度,往往要退而求其次,改用較細或較專門的模型;Ultrafast 則是嘗試在「每秒完成更多實際工作」上取得突破。
OpenAI 預計,事故應變、金融研究、客戶服務、電商營運及實時研究等工作流程,會最先受惠。工程團隊可在系統事故發生期間,利用 Ultrafast 審視即時日誌、traces 及最新程式碼變更;客服系統則有能力在通話期間處理多步驟、較複雜的查詢。
延伸閱讀:Anthropic 爭取 60 億美元 Decart 融資 同步籌備上市
GPT-5.6 Sol 的應用影響
早期企業用戶認為,加速之後,模型能更自然地嵌入互動式工作流程之中。Jane Street 的 John Crepezzi 形容性能提升「相當驚人」,並指出這令與模型並肩專注工作的可行性大增。
Podium 語音 AI 產品主管 Courtland Lykins 表示,Ultrafast 對公司語音技術堆疊幫助明顯,「速度完全改變了複雜通話的體驗」。OpenAI 補充,金融研究人員可在市場訊號、交易數據不斷變化之際,進行即時分析,而毋須再依賴較慢的批次處理;這類用例高度倚重快速更新的輸入數據。
不過,預覽階段現時主要受制於基建容量,而非法規或策略性封測。OpenAI 指出,會先吸收首批企業客戶的實際使用反饋,評估在哪些場景下速度提升最能創造價值,之後才會再擴大開放。
OpenAI 與 Cerebras 的合作早於 Ultrafast 前已展開。OpenAI 今年 1 月宣布與這家晶片商結盟,計劃為其平台新增約 750 兆瓦、低延遲的 AI 運算資源。到 2 月,GPT-5.3-Codex-Spark 成為首個落實於該合作上的模型,透過 Cerebras 硬件,在即時編碼場景中把輸出速度推高至每秒逾 1,000 個 tokens。





