OpenAI 推出全新 Ultrafast 超高速预览服务层级,使 GPT-5.6 Sol 在特定场景下推理速度最高可达标准模式的 14 倍,生成速度最高约为每秒 750 个输出 token。
关键信息一览
- Ultrafast 令 GPT-5.6 Sol 推理速度最高提升至标准处理的 14 倍。
- Cerebras 提供底层算力支持,单模型最高输出可达每秒约 750 个 tokens。
- 目前处于有限预览阶段,OpenAI 计划在算力容量提升后逐步扩大开放范围。
Ultrafast 预览服务详情
OpenAI 于 8 月 13 日发布公告,首次推出以速度为核心卖点的 Ultrafast 服务层级,当前通过 API 向少数客户开放试用。公司表示,未来将随着算力资源扩充,逐步放宽接入门槛。
这一模式由 Cerebras 提供底层硬件支持,并专门设计,在尽量保持 GPT-5.6 Sol 模型能力的前提下,大幅压缩生成回复所需时间。所谓输出 tokens,即模型生成文本的基本单位。OpenAI 指出,以往若要获得接近实时的交互体验,用户往往不得不选择规模更小、功能更窄的模型,而 Ultrafast 的目标是实现“单位时间内完成更多有用工作”。
按照 OpenAI 的设想,事件响应、金融研究、客户支持、电商及实时研究,将是最先受益的几个业务场景。工程团队可以在系统故障发生的当下,借助该模式快速审阅日志、调用链和近期代码变更;客服系统则有望在实时对话中完成多步复杂请求的处理。
延伸阅读: Anthropic Pursues A $6B Decart Deal While Preparing To Go Public
GPT-5.6 Sol 加速效应
部分早期客户表示,速度的提升正在改变大模型融入交互式工作流的方式。量化交易公司 Jane Street 的 John Crepezzi 称,这一提速“相当惊人”,令人机协同开展高强度专注工作变得更为可行。
Podium 语音 AI 产品负责人 Courtland Lykins 表示,Ultrafast 对公司语音技术栈价值显著,因为“速度完全改变了复杂呼叫场景下的通话体验”。OpenAI 还指出,金融研究人员可以在不依赖传统批处理的情况下,持续分析不断变化的市场信号与交易数据,而这一用例高度依赖快速更新的输入信息。
目前 Ultrafast 的推广仍受限于基础设施容量,而非面向公众全面开放。OpenAI 称,正基于首批企业用户的实际反馈,评估在哪些具体环节加速能够释放最大业务价值,再据此决定后续扩容路径。
与 Cerebras 的合作早在 Ultrafast 之前就已启动。OpenAI 今年 1 月宣布与该芯片公司达成合作,引入约 750 兆瓦、专注低时延 AI 推理的算力资源。2 月发布的 GPT-5.3-Codex-Spark 是双方合作下的首个落地模型,依托 Cerebras 硬件,在实时编程场景中输出速度突破每秒 1,000 个 token。
下一篇: Virtuals Protocol Trading Volume Explodes 180%, Bulls Eye $0.68





