Los expertos se dividen sobre Claude Opus 5 tras las primeras pruebas independientes

Testers scored Anthropic's latest release at 159 on a capability index, and the first reviews landed on opposite sides. (Image: Shutterstock)
Testers scored Anthropic's latest release at 159 on a capability index, and the first reviews landed on opposite sides. (Image: Shutterstock)

Evaluadores independientes han situado el nuevo modelo de Anthropic, Claude Opus 5, en 159 puntos en un índice de capacidades, dos por debajo de Claude Fable 5, mientras se abre una fuerte brecha de opiniones sobre su desempeño en revisión de código.

Claves:

  • Epoch AI puntuó Claude Opus 5 con 159 en su índice de capacidades, frente a 161 de Claude Fable 5, con empate técnico en ingeniería de software.
  • CodeRabbit midió un 39,3% de precisión en comentarios de revisión accionables, frente a un 35,2% de referencia, pero con cuatro veces más “nitpicks”.
  • Clientes corporativos como Cognition y Zapier informan de mejoras en depuración y automatización integral de procesos de negocio.

Los benchmarks de Claude Opus 5, bajo la lupa desde el inicio

Anthropic lanzó el modelo el viernes y afirmó que se aproxima a la inteligencia de frontera de Fable 5 a mitad de precio, presentándolo como una herramienta de uso diario más que como un modelo especializado. Los evaluadores externos coinciden en lo esencial, pero discrepan en el tamaño de la brecha.

Epoch AI situó Opus 5 en 159 puntos en su índice de capacidades, frente a 161 de Fable 5, y los consideró equivalentes en ingeniería de software, según un repaso de Latent Space recogido.

Artificial Analysis colocó el modelo en primera posición en su benchmark de trabajo del conocimiento con agentes, superando a Fable 5 por casi 150 puntos Elo y recortando el coste por tarea en un 20%. Algunos desarrolladores cuestionaron esa lectura del índice: sostienen que una mejora de solo un punto frente al antiguo Opus 4.8 infravalora lo que observan en el uso diario. Un evaluador incluso detectó que un nivel de “esfuerzo medio” superaba a configuraciones más agresivas en una prueba de programación.

También te puede interesar: BitMEX cierra tras 11 años sin encontrar comprador

Veredictos opuestos en las pruebas de revisión de código

CodeRabbit enfrentó Opus 5 a unas 100 tipologías de errores extraídas de pull requests reales de código abierto, con tres pasadas por configuración, y midió un 39,3% de precisión en comentarios accionables.

La cifra supera el 35,2% que marca su revisor en producción, pero el modelo detectó menos errores conocidos y generó cuatro veces más observaciones de bajo valor —los “nitpicks” que los ingenieros deben cribar manualmente.

Con la configuración de esfuerzo por defecto, la precisión cayó al 26,4%. La firma concluye que los equipos deberían tratar Opus 5 como un segundo revisor orientado a la precisión, no como una sustitución directa de un flujo de revisión de código que ya funciona. Claire Vo, que dirige una evaluación con siete modelos para equipos de producto, definió el modelo como brillante pero molesto, apuntando a un sesgo “neurótico” y a un conflicto de merge que se negó categóricamente a resolver.

Los clientes de Anthropic señalan avances en agentes

Scott Wu, consejero delegado de Cognition, aseguró que Opus 5 se aproxima al rendimiento de Fable a mitad de coste dentro de Devin, con especial fortaleza en depuración y análisis de causa raíz. Wade Foster, máximo responsable de Zapier, señaló que el modelo lidera ahora el ránking interno de automatización de la compañía sin consumir más tokens que versiones anteriores de Claude con el mismo precio de 5 dólares por millón de tokens de entrada.

Los elogios llegaron con matices. Anthropic advirtió de que Opus 5 va por detrás de su modelo Mythos 5 en tareas de ciberseguridad ofensiva, y que las solicitudes que disparan los clasificadores de seguridad de la compañía se redirigen automáticamente a Opus 4.8.

Esa cautela llega tras una etapa complicada para la gama alta: Fable 5 se lanzó en junio, fue retirado a los pocos días y regresó a los usuarios a principios de julio.

Próximo artículo: HubSpot cayó un 12,7% y los analistas señalan directamente al nuevo agente de OpenAI

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev es el Jefe de Contenido en Yellow.com y ha informado sobre criptomonedas durante los últimos 10 años. Se especializa en artículos de Investigación y Aprendizaje en profundidad, con un enfoque en reportes analíticos, contexto de la industria y las grandes fuerzas que dan forma al cripto, desde la era de la IA y las tecnologías de seguridad hasta la innovación fintech. Cree que todo lo digital superará inminentemente a todo lo analógico y trabaja arduamente para hacerlo realidad.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Últimas noticias
Ver todas las noticias
Los expertos se dividen sobre Claude Opus 5 tras las primeras pruebas independientes | Yellow