Expertos se dividen sobre Claude Opus 5 tras las primeras pruebas independientes

Expertos se dividen sobre Claude Opus 5 tras las primeras pruebas independientes

Evaluadores independientes han otorgado al nuevo modelo de Anthropic, Claude Opus 5, una puntuación de 159 puntos en un índice de capacidades, dos por debajo de Claude Fable 5, mientras las opiniones se polarizan en torno a su desempeño en revisión de código.

Puntos clave:

  • Epoch AI situó Claude Opus 5 en 159 puntos en su índice de capacidad, frente a 161 para Claude Fable 5, con un empate técnico en ingeniería de software.
  • CodeRabbit registró un 39,3% de precisión en comentarios de revisión accionables, frente a un 35,2% de referencia, pero con cuatro veces más comentarios triviales.
  • Clientes corporativos como Cognition y Zapier reportaron mejoras en depuración y automatización de procesos de negocio de extremo a extremo.

Los ‘benchmarks’ de Claude Opus 5, bajo la lupa desde el primer día

Anthropic lanzó el modelo el viernes y afirmó que se acerca a la inteligencia de frontera de Fable 5 a mitad de precio, presentándolo como una herramienta de uso diario más que como un producto de nicho. Los evaluadores externos coinciden en lo esencial, pero discrepan en los matices.

Epoch AI colocó Opus 5 en 159 puntos en su índice de capacidades, frente a los 161 de Fable 5, y consideró que ambos empatan en ingeniería de software, según un resumen de Latent Space publicado.

Artificial Analysis situó el modelo en primer lugar en su ‘benchmark’ de trabajo del conocimiento con agentes, superando a Fable 5 por casi 150 puntos Elo y reduciendo el coste por tarea en un 20%. Algunos desarrolladores cuestionaron el índice de capacidad: sostienen que una mejora de apenas un punto frente al anterior Opus 4.8 desvirtúa, a la baja, el salto que observan en el uso diario. Un evaluador detectó que el nivel de esfuerzo medio rendía mejor que configuraciones superiores en una prueba de programación.

También te puede interesar: BitMEX cierra tras 11 años sin encontrar comprador

La revisión de código fractura el veredicto de los testers

CodeRabbit probó Opus 5 frente a unas 100 tipologías de error tomadas de ‘pull requests’ reales de código abierto, con tres pasadas por configuración, y midió un 39,3% de precisión en comentarios accionables.

La cifra supera el 35,2% de referencia marcado por su revisor en producción, pero el modelo detectó menos errores conocidos y generó cuatro veces más ‘nitpicks’: observaciones de escaso valor que los ingenieros deben cribar manualmente.

Con el esfuerzo por defecto, la precisión cayó al 26,4%. La firma concluyó que los equipos deberían tratar Opus 5 como un segundo revisor, más orientado a la precisión, y no como una sustitución directa de una canalización de revisión que ya funciona. Claire Vo, que dirige una evaluación comparativa con siete modelos para equipos de producto, definió el sistema como brillante pero irritante, aludiendo a un perfil neurótico y a un conflicto de ‘merge’ que se negó por completo a resolver.

Los clientes de Anthropic destacan avances como agente

Scott Wu, consejero delegado de Cognition, afirmó que Opus 5 se acerca al rendimiento de Fable a mitad de coste dentro de Devin, con especial solidez en depuración y análisis de causa raíz. Wade Foster, máximo responsable de Zapier, señaló que el modelo se situó en cabeza del ránking de automatización de la compañía sin consumir más ‘tokens’ que las versiones anteriores de Claude, con el mismo precio de 5 dólares por millón de tokens de entrada.

Los elogios llegan con matices. Anthropic reconoce que Opus 5 queda por detrás de su modelo Mythos 5 en capacidades ofensivas de ciberseguridad y que las solicitudes que activan los clasificadores de seguridad de la compañía se redirigen automáticamente a Opus 4.8.

La cautela responde a una racha inestable en la gama alta: Fable 5 se lanzó en junio, fue retirado a los pocos días y regresó a los usuarios a comienzos de julio.

Próximo artículo: HubSpot cae un 12,7% y los analistas señalan directamente al nuevo agente de OpenAI

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Expertos se dividen sobre Claude Opus 5 tras las primeras pruebas independientes | Yellow