OpenAI 宣布推出全新 Ultrafast 预览服务层,支持其前沿大模型 GPT-5.6 Sol 以最高 14 倍于标准模式的速度运行,输出速率最高可达每秒 750 个 token。
要点速览:
- Ultrafast 将 GPT-5.6 Sol 的推理速度最高提升至标准处理模式的 14 倍。
- Cerebras 提供底层算力支撑,使该模式能实现每秒最高 750 个输出 token。
- 服务目前处于有限预览阶段,OpenAI 计划在算力扩容后逐步开放更大规模访问。
OpenAI Ultrafast 预览
OpenAI 于 8 月 13 日通过官方渠道发布公告,率先在 API 中上线主打速度的 Ultrafast 服务层,目前仅向部分客户开放。公司表示,将在产能提升后扩大可用范围。
该服务由 Cerebras 提供底层硬件支持,并专门设计以在保持 GPT-5.6 Sol 能力不减的前提下,大幅压缩生成响应的时间。token 是模型生成文本的基本单位。OpenAI 指出,过去若要实现近实时性能,用户往往只能选择更小或更窄场景的模型,而 Ultrafast 的目标是实现“每秒完成更多有价值工作”。
OpenAI 预期,事故响应、金融研究、客户支持、电商与实时研究等场景将率先受益。工程团队可以在系统故障发生时,利用该模式即时审查日志、追踪链路和最新代码变更;客服系统则可在实时对话中完成多步骤复杂请求的处理。
延伸阅读:Anthropic 计划融资 60 亿美元收购 Decart 并筹备上市
GPT-5.6 Sol 的应用影响
早期企业用户表示,加速后的模型正在重塑其在交互式工作流中的定位。来自 Jane Street 的 John Crepezzi 称这一速度提升“相当惊人”,并表示这使得与模型并行开展专注型工作变得更为可行。
Podium 语音 AI 产品负责人 Courtland Lykins 表示,Ultrafast 对公司语音技术栈价值显著,因为“速度完全改变了复杂业务电话的体验”。OpenAI 还指出,在金融场景中,研究人员可以在无需等待传统批处理的情况下,实时分析不断变化的市场信号与交易数据,而这一用例高度依赖快速变化的输入。
目前该预览仍受限于基础设施产能,而非面向大众全面放开。OpenAI 表示,正基于首批企业客户的反馈,评估在哪些具体场景中速度提升最能转化为业务价值,再决定扩大开放节奏。
与 Cerebras 的合作早于 Ultrafast 发布。OpenAI 今年 1 月宣布与这家芯片公司达成合作,将为其平台新增 750 兆瓦的低时延 AI 算力。今年 2 月,GPT-5.3-Codex-Spark 成为该合作框架下首个落地模型,利用 Cerebras 硬件在实时编程场景中实现了每秒超过 1000 个 token 的输出。





