OpenAI 推出全新 Ultrafast 預覽服務層級,讓 GPT-5.6 Sol 的推理效能最高可較標準模式快 14 倍,輸出速度最高達每秒 750 個 token,鎖定各種需要「近即時」運算的企業工作流程。
重點整理:
- Ultrafast 讓 GPT-5.6 Sol 的執行速度最高可比標準處理快 14 倍。
- 這項模式由 Cerebras 提供算力支援,輸出速度可達每秒 750 個 token。
- 目前屬限量預覽階段,OpenAI 表示會隨產能擴充逐步開放更多客戶使用。
OpenAI Ultrafast 預覽服務
OpenAI 於 8 月 13 日宣布 Ultrafast,首先透過 API 向少數客戶提供這個「極致速度優先」的新層級。公司表示,會在後端容量提升後擴大對外開放。
Ultrafast 由 Cerebras 提供底層硬體架構,並設計成在維持 GPT-5.6 Sol 原有能力的情況下,大幅縮短生成回應所需時間。所謂 output token,指的是模型生成文字的基本單位。OpenAI 指出,過去若要達成近即時的互動體驗,多半得犧牲模型規模或功能;Ultrafast 則是希望在「每秒可完成的有效工作量」上取得突破。
OpenAI 看好 Ultrafast 對事件應變、金融研究、客戶支援、電商以及即時研究等場景的加值效果。工程團隊可在事故發生當下,用此模式快速分析紀錄、追蹤 trace、檢視近期程式變更;客服系統則能在真人通話中動態處理多步驟的複雜請求。
延伸閱讀:Anthropic 爭取 60 億美元 Decart 融資、同時籌備上市計畫
GPT-5.6 Sol 的實際影響
早期企業用戶表示,速度的提升讓模型更容易融入互動式工作流程。Jane Street 的 John Crepezzi 形容這次效能躍進「相當驚人」,並指出這讓人類與模型並肩進行專注工作變得更實際可行。
Podium 負責語音 AI 產品的 Courtland Lykins 則說,Ultrafast 對公司語音技術堆疊「非常關鍵」,因為在處理複雜任務時,「速度徹底改變了整體通話體驗」。OpenAI 也提到,金融研究人員可在不必等待傳統批次處理的情況下,即時分析不斷變化的市場訊號與交易流,這類應用高度仰賴持續更新的輸入資料。
不過,目前 Ultrafast 預覽仍受限於基礎設施產能,尚未全面開放。OpenAI 表示,正根據首批合作企業的使用回饋,評估在哪些場景能創造最大邊際效益,再決定如何擴大供應。
OpenAI 與 Cerebras 的合作關係早在 Ultrafast 之前就已展開。OpenAI 於今年 1 月宣布與這家晶片商結盟,計畫為其平台導入 750 兆瓦、具低延遲特性的 AI 運算資源。今年 2 月,GPT-5.3-Codex-Spark 成為首個掛勾此合作的模型,透過 Cerebras 硬體在即時程式碼生成場景中,每秒輸出量突破 1,000 個 token。





