OpenAI a dévoilé Ultrafast, un niveau de service en préversion qui exécute GPT-5.6 Sol jusqu’à 14 fois plus vite que le mode standard et peut générer jusqu’à 750 jetons de sortie par seconde.
Points clés :
- Ultrafast fait tourner GPT-5.6 Sol jusqu’à 14 fois plus vite que le traitement standard.
- Cerebras alimente ce mode, capable de produire jusqu’à 750 jetons de sortie par seconde.
- Le service est en préversion limitée, avec un élargissement progressif de l’accès à mesure que la capacité augmente.
Préversion d’OpenAI Ultrafast
OpenAI a annoncé Ultrafast le 13 août, en lançant d’abord ce palier axé sur la vitesse via son API pour un groupe restreint de clients. La société précise que l’accès sera étendu au fur et à mesure de la montée en charge de l’infrastructure.
Le service s’appuie sur la technologie de Cerebras et est conçu pour préserver les capacités de GPT-5.6 Sol tout en réduisant fortement le temps nécessaire à la production de réponses. Les jetons de sortie sont des fragments de texte généré. OpenAI rappelle qu’obtenir des performances quasi temps réel impliquait jusqu’ici de se rabattre sur un modèle plus petit ou très spécialisé, alors qu’Ultrafast vise à offrir « plus de travail utile par seconde ».
OpenAI cite parmi les principaux cas d’usage la réponse à incident, la recherche financière, le service client, le commerce en ligne et la recherche en direct. Les ingénieurs peuvent s’appuyer sur ce mode pour analyser journaux, traces et changements récents de code pendant une panne, tandis que les systèmes de support peuvent traiter des demandes en plusieurs étapes au fil d’une conversation.
À lire aussi : Anthropic vise un accord Decart de 6 milliards de dollars en vue de son introduction en Bourse
L’impact de GPT-5.6 Sol
Les premiers clients expliquent que ce gain de vitesse change la façon dont le modèle s’intègre au travail interactif. John Crepezzi, de Jane Street, parle d’une progression « impressionnante » qui rend beaucoup plus praticable le travail concentré aux côtés des modèles.
Courtland Lykins, responsable produit pour la voix IA chez Podium, indique qu’Ultrafast est devenu un maillon clé de la pile vocale de l’entreprise, car « la vitesse transforme complètement l’expérience d’appel » pour les tâches complexes. OpenAI ajoute que les analystes financiers peuvent suivre des signaux de marché et des flux de transactions en évolution rapide sans subir les lenteurs de traitements par lots, un cas d’usage fortement dépendant d’entrées qui changent en continu.
La préversion reste contrainte par les capacités d’infrastructure plutôt que par une volonté de déploiement grand public immédiat. OpenAI affirme s’appuyer sur les retours des premiers clients pour identifier les domaines où le surplus de vitesse crée le plus de valeur avant d’ouvrir davantage le service.
Le lien avec Cerebras est antérieur à Ultrafast. OpenAI avait annoncé en janvier un partenariat avec le fabricant de puces afin d’ajouter 750 mégawatts de puissance de calcul IA à faible latence à sa plateforme. En février, GPT-5.3-Codex-Spark est devenu le premier modèle issu de cette alliance, tirant parti du matériel de Cerebras pour dépasser les 1 000 jetons par seconde en génération de code temps réel.
À suivre : Le volume d’échanges de Virtuals Protocol explose de 180 %, les haussiers visent 0,68 $





