Evaluadores independientes han situado el nuevo modelo de Anthropic, Claude Opus 5, en 159 puntos en un índice de capacidades, dos por debajo de Claude Fable 5, mientras se abre una fuerte brecha de opiniones sobre su desempeño en revisión de código.
Claves:
- Epoch AI puntuó Claude Opus 5 con 159 en su índice de capacidades, frente a 161 de Claude Fable 5, con empate técnico en ingeniería de software.
- CodeRabbit midió un 39,3% de precisión en comentarios de revisión accionables, frente a un 35,2% de referencia, pero con cuatro veces más “nitpicks”.
- Clientes corporativos como Cognition y Zapier informan de mejoras en depuración y automatización integral de procesos de negocio.
Los benchmarks de Claude Opus 5, bajo la lupa desde el inicio
Anthropic lanzó el modelo el viernes y afirmó que se aproxima a la inteligencia de frontera de Fable 5 a mitad de precio, presentándolo como una herramienta de uso diario más que como un modelo especializado. Los evaluadores externos coinciden en lo esencial, pero discrepan en el tamaño de la brecha.
Epoch AI situó Opus 5 en 159 puntos en su índice de capacidades, frente a 161 de Fable 5, y los consideró equivalentes en ingeniería de software, según un repaso de Latent Space recogido.
Artificial Analysis colocó el modelo en primera posición en su benchmark de trabajo del conocimiento con agentes, superando a Fable 5 por casi 150 puntos Elo y recortando el coste por tarea en un 20%. Algunos desarrolladores cuestionaron esa lectura del índice: sostienen que una mejora de solo un punto frente al antiguo Opus 4.8 infravalora lo que observan en el uso diario. Un evaluador incluso detectó que un nivel de “esfuerzo medio” superaba a configuraciones más agresivas en una prueba de programación.
También te puede interesar: BitMEX cierra tras 11 años sin encontrar comprador
Veredictos opuestos en las pruebas de revisión de código
CodeRabbit enfrentó Opus 5 a unas 100 tipologías de errores extraídas de pull requests reales de código abierto, con tres pasadas por configuración, y midió un 39,3% de precisión en comentarios accionables.
La cifra supera el 35,2% que marca su revisor en producción, pero el modelo detectó menos errores conocidos y generó cuatro veces más observaciones de bajo valor —los “nitpicks” que los ingenieros deben cribar manualmente.
Con la configuración de esfuerzo por defecto, la precisión cayó al 26,4%. La firma concluye que los equipos deberían tratar Opus 5 como un segundo revisor orientado a la precisión, no como una sustitución directa de un flujo de revisión de código que ya funciona. Claire Vo, que dirige una evaluación con siete modelos para equipos de producto, definió el modelo como brillante pero molesto, apuntando a un sesgo “neurótico” y a un conflicto de merge que se negó categóricamente a resolver.
Los clientes de Anthropic señalan avances en agentes
Scott Wu, consejero delegado de Cognition, aseguró que Opus 5 se aproxima al rendimiento de Fable a mitad de coste dentro de Devin, con especial fortaleza en depuración y análisis de causa raíz. Wade Foster, máximo responsable de Zapier, señaló que el modelo lidera ahora el ránking interno de automatización de la compañía sin consumir más tokens que versiones anteriores de Claude con el mismo precio de 5 dólares por millón de tokens de entrada.
Los elogios llegaron con matices. Anthropic advirtió de que Opus 5 va por detrás de su modelo Mythos 5 en tareas de ciberseguridad ofensiva, y que las solicitudes que disparan los clasificadores de seguridad de la compañía se redirigen automáticamente a Opus 4.8.
Esa cautela llega tras una etapa complicada para la gama alta: Fable 5 se lanzó en junio, fue retirado a los pocos días y regresó a los usuarios a principios de julio.
Próximo artículo: HubSpot cayó un 12,7% y los analistas señalan directamente al nuevo agente de OpenAI






