Grok 4.5 supera a Fable 5 y Opus 4.8 en test de agentes de IA con un 51,4%

Grok 4.5 supera a Fable 5 y Opus 4.8 en test de agentes de IA con un 51,4%

Grok 4.5 acaba de darle nueva munición al argumento de Elon Musk sobre coste y rendimiento, después de que un test independiente de agentes situara al modelo en el primer puesto.

Claves del informe

  • Grok 4.5 obtuvo un 51,4% en AutomationBench-AA, por delante de dos modelos Claude.
  • El coste por tarea fue de 0,34 dólares, muy por debajo de sus rivales de Anthropic.
  • Su mayor tasa de infracciones de normas sigue siendo un riesgo para despliegues empresariales de agentes.

El benchmark de Grok

Artificial Analysis señaló que Grok 4.5 alcanzó un 51,4% en AutomationBench-AA, superando a Claude Fable 5, con un 48,6%, y a Claude Opus 4.8, con un 48,5%. El modelo también se impuso en precio: 0,34 dólares por tarea, frente a los 1,35 dólares de Fable 5 y los 1,46 dólares de Opus 4.8.

El benchmark aporta una validación externa a la afirmación de Musk de que Grok 4.5 es un modelo de clase Opus que corre más rápido y a menor coste. SpaceXAI abrió el modelo al público esta semana, apoyándose en una base V9 de 1,5 billones de parámetros y en evaluaciones internas preliminares para enmarcar el lanzamiento.

AutomationBench-AA agrupa 657 tareas en 40 aplicaciones simuladas, entre ellas Gmail, Slack, Salesforce y HubSpot. El test evalúa si un agente de IA logra completar los objetivos sin saltarse las barreras de seguridad, y Artificial Analysis mantiene el conjunto de tareas en privado para limitar la contaminación del benchmark.

También te puede interesar: Grok 4.5 desafía a OpenAI y Anthropic con una IA de agentes más barata

La apuesta de Musk

Según Artificial Analysis, Grok 4.5 utilizó unos 8.000 tokens de salida por tarea, aproximadamente una cuarta parte del total de Opus 4.8. “Su consumo total de tokens, 0,44 millones por tarea, está entre los más bajos del ranking”, indicó la firma, que atribuye el bajo coste a la eficiencia y a la estructura de precios por token.

El modelo completó el 79,9% de los objetivos y superó íntegramente el 21,9% de las tareas. En finanzas, el segmento más exigente del benchmark, Grok 4.5 lideró con un 71%, frente al 64% de Fable 5 y el 62% de Opus 4.8.

Su talón de Aquiles fue el cumplimiento normativo. Grok 4.5 registró 0,63 infracciones de guardrails por tarea, por encima de las 0,55 de Opus 4.8 y de las 0,46 de Gemini 3.5 Flash de Google, una diferencia relevante para empresas que despliegan agentes cerca de sistemas financieros en producción.

El mensaje de lanzamiento de Musk se centró en un compromiso práctico más que en una victoria limpia en todos los frentes. Grok 4.5 ya cuenta con un aval externo en coste y velocidad, pero su mayor tasa de violaciones de normas explica por qué la adopción corporativa seguirá dependiendo de la fiabilidad.

Próxima lectura: La recuperación de Bitcoin tiene un problema de demanda que los alcistas no pueden ignorar

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.