OpenAI lançou o Ultrafast, uma nova camada de serviço em prévia que executa o GPT-5.6 Sol até 14 vezes mais rápido que o processamento padrão, gerando até 750 tokens de saída por segundo.
Principais pontos:
- Ultrafast executa o GPT-5.6 Sol até 14 vezes mais rápido do que o modo padrão.
- A Cerebras fornece a infraestrutura do modo, que entrega até 750 tokens por segundo.
- O serviço está em prévia limitada, com expansão planejada à medida que a capacidade cresce.
Prévia do OpenAI Ultrafast
A OpenAI anunciou o Ultrafast em 13 de agosto, lançando primeiro, via API, uma camada focada em velocidade para um grupo restrito de clientes. A empresa afirma que o acesso será ampliado conforme a infraestrutura for escalada.
O serviço é alimentado pela Cerebras e foi projetado para preservar as capacidades do GPT-5.6 Sol, reduzindo ao mesmo tempo o tempo necessário para produzir respostas. Tokens de saída são fragmentos de texto gerado. Segundo a OpenAI, até aqui, desempenho em tempo quase real normalmente exigia recorrer a modelos menores ou altamente especializados, enquanto o Ultrafast mira “mais trabalho útil por segundo”.
A OpenAI cita resposta a incidentes, pesquisa financeira, atendimento ao cliente, comércio eletrônico e pesquisa em tempo real entre os fluxos de trabalho que devem se beneficiar mais. Engenheiros podem usar o modo para revisar logs, traces e alterações recentes de código em meio a uma indisponibilidade, enquanto sistemas de suporte conseguem lidar com pedidos de múltiplas etapas durante conversas ao vivo.
Leia também: Anthropic busca acordo Decart de US$ 6 bi enquanto se prepara para IPO
Impacto do GPT-5.6 Sol
Clientes iniciais afirmam que o ganho de velocidade muda o papel do modelo em fluxos de trabalho interativos. John Crepezzi, da Jane Street, classificou o salto como “impressionante” e disse que ele torna mais viável realizar trabalho focado lado a lado com os modelos.
Courtland Lykins, líder de produto de voz em IA na Podium, disse que o Ultrafast tem sido decisivo para a pilha de voz da empresa porque “a velocidade muda completamente a experiência de ligação” em tarefas complexas. A OpenAI acrescenta que analistas financeiros podem examinar sinais de mercado e transações em rápida mutação sem depender de demoras típicas de processamento em lote, um caso de uso que exige entradas atualizadas em alta frequência.
A prévia continua limitada mais por infraestrutura do que por estratégia comercial. A OpenAI diz estar usando o feedback das primeiras empresas para definir onde a velocidade gera mais valor antes de ampliar o acesso.
A parceria com a Cerebras antecede o Ultrafast. Em janeiro, a OpenAI anunciou um acordo com a fabricante de chips para adicionar 750 megawatts de computação de IA de baixa latência à sua plataforma. Em fevereiro, o GPT-5.3-Codex-Spark tornou-se o primeiro modelo vinculado a essa parceria, usando hardware da Cerebras para superar 1.000 tokens por segundo em tarefas de código em tempo real.
Próximo artigo: Volume negociado de Virtuals Protocol dispara 180%; alta mira US$ 0,68





