OpenAI 推出全新 Ultrafast 預覽服務層級,讓 GPT-5.6 Sol 在特定情境下可比標準模式快上 14 倍,輸出速度最高可達每秒 750 個 token。
重點整理:
- Ultrafast 讓 GPT-5.6 Sol 的處理速度最高可達標準模式的 14 倍。
- Cerebras 提供底層運算能力,實現最高每秒 750 個輸出 token。
- 目前為限量預覽階段,將視算力擴充情況逐步開放更多用戶使用。
OpenAI Ultrafast 預覽服務
OpenAI 於 8 月 13 日宣布 Ultrafast,率先透過 API 形式提供給一小部分客戶試用,並表示會隨著運算容量擴增,逐步開放更多用戶。
此服務由 Cerebras 硬體支援,設計目標是在維持 GPT-5.6 Sol 既有能力的前提下,大幅縮短回應生成時間。所謂輸出 token,指的是模型所產生文字的最小片段。OpenAI 指出,過去若要追求近乎即時的互動,往往必須退而求其次,選擇較小或較專門化的模型,而 Ultrafast 的目標則是「在每一秒內完成更多有用工作」。
OpenAI 看好多種工作流程將因此受惠,包括資安事件應變、金融研究、客服、電商與即時研究等。工程團隊可在異常或系統中斷發生時,透過 Ultrafast 即時檢視紀錄、追蹤與最新程式碼變更;客服系統則能在真人對談中處理多步驟、複雜的需求流程。
延伸閱讀:Anthropic 採購 60 億美元 Decart 設備、佈局上市計畫
GPT-5.6 Sol 的實質影響
首批客戶表示,加速後的體驗顛覆了模型在互動式工作流程中的角色定位。Jane Street 的 John Crepezzi 形容這次的性能提升「相當驚人」,讓人機協作、專注處理特定任務變得更實際可行。
Podium 負責語音 AI 產品的 Courtland Lykins 則指出,Ultrafast 對公司語音技術堆疊的價值顯著,因為「速度徹底改變了複雜通話的整體體驗」。OpenAI 也補充,金融研究人員藉此可在市場訊號與交易明細快速變動時,進行即時分析,而不必等待傳統批次處理完成;此類應用高度仰賴快速變動的輸入資料。
目前預覽計畫仍受限於基礎設施產能,尚未全面對大眾開放。OpenAI 表示,正透過首批企業用戶的實際回饋,評估在哪些工作流程中,速度提升能創造最大價值,再決定下一階段的擴張方向。
OpenAI 與 Cerebras 的合作並非始於 Ultrafast。早在今年 1 月,OpenAI 就宣布與該晶片商結盟,計畫為其平台導入 750 兆瓦等級、低延遲的 AI 運算資源。今年 2 月,上線的 GPT-5.3-Codex-Spark 是此合作下的首款模型,透過 Cerebras 硬體讓即時程式碼生成速度突破每秒 1,000 個 token。





