Anthropic lanzó Claude Sonnet 5.5 este lunes y afirma que su nuevo modelo de IA de gama media funciona más de un 30% más rápido y puede rebajar hasta en un 30% el coste por tarea frente a la versión anterior.
Claves:
- Sonnet 5.5 logró un 70,6% en la prueba de programación Terminal-Bench 4.0, frente al 10,3% de Sonnet 5.
- Es el primer modelo Sonnet que se lanza con protecciones cibernéticas antes reservadas a los sistemas de máximo nivel de Anthropic.
- Un benchmark independiente indica que, al máximo esfuerzo, el coste por tarea sería superior al de Sonnet 5.
Benchmarks de Claude Sonnet 5.5
Es el segundo modelo de la familia Claude 5.5 y llegó seis días después del buque insignia Claude Opus 5.5, según informó la compañía en su anuncio.
Anthropic lo presenta como un complemento más rápido y asequible de Opus 5.5, orientado a tareas cotidianas bien definidas, corrección de errores y la generación de documentos, presentaciones y hojas de cálculo pulidos. Su precio es de 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida.
En Terminal-Bench 4.0, una prueba de programación “agentic”, Sonnet 5.5 obtuvo un 70,6%, frente al 10,3% de Sonnet 5 y el 66,4% del más caro Opus 5.5. También se convirtió en el primer modelo Sonnet capaz de completar Pokémon Red solo a partir de capturas de pantalla, una prueba de trabajo de largo recorrido y comprensión de imagen.
El modelo ya está disponible en todas las plataformas de Anthropic, incluidas Amazon Web Services, Google Cloud y Microsoft Azure. Anthropic adelantó que el más compacto Claude Haiku 5.5, pensado para volúmenes muy altos y casos de uso especialmente sensibles al coste, llegará en las próximas semanas, completando así la gama de tres modelos.
También puede leer: OpenAI pisa el freno a la IA Frontier tras su fuga del sandbox del 20 de septiembre
Salvaguardas y costes de Sonnet 5.5
Anthropic citó a Daniel Vogel, director de operaciones de Epic Games, quien explicó que el modelo manejó decenas de miles de líneas de código de sistemas de juego en las pruebas iniciales. Vogel señaló que “superó el mismo listón de calidad que se exigiría a un modelo de gama superior”.
Dado que sus capacidades en ciberseguridad son comparables a las de Opus 5, Sonnet 5.5 es el primer Sonnet que se lanza con las salvaguardas que Anthropic reservaba a sus sistemas más avanzados. La corrección rutinaria de bugs no se ve afectada, pero las peticiones cibernéticas de mayor riesgo se redirigen de forma visible a Sonnet 5. Nuevos clasificadores también bloquean los intentos de extraer su razonamiento interno.
No todas las pruebas respaldan la promesa de ahorro. Artificial Analysis habría medido un coste ponderado de 7,60 dólares por tarea de benchmark al máximo esfuerzo, frente a 5,09 dólares en Sonnet 5, pese a que la puntuación de índice del nuevo modelo subió a 56 desde 38.
El lanzamiento llega tras la presentación, el 22 de septiembre, de Opus 5.5, cuando Anthropic redujo un 20% el precio de su modelo insignia, hasta 4 dólares por millón de tokens de entrada y 20 dólares por millón de tokens de salida. Entonces la compañía aseguró que Opus 5.5 costaría alrededor de un 40% menos que Opus 5 en cargas de trabajo típicas y generaría respuestas más de un 30% más rápido. OpenAI lanzó ese mismo día GPT-6 Sol y GPT-6 Luna, con precios equivalentes a la mitad de sus predecesores.
Lea también: BlackRock afirma que la potencia de cómputo se encamina hacia los mercados de futuros

