Grok 4.5 acaba de darle nueva munición al argumento de Elon Musk sobre coste y rendimiento, después de que un test independiente de agentes situara al modelo en el primer puesto.
Claves del informe
- Grok 4.5 obtuvo un 51,4% en AutomationBench-AA, por delante de dos modelos Claude.
- El coste por tarea fue de 0,34 dólares, muy por debajo de sus rivales de Anthropic.
- Su mayor tasa de infracciones de normas sigue siendo un riesgo para despliegues empresariales de agentes.
El benchmark de Grok
Artificial Analysis señaló que Grok 4.5 alcanzó un 51,4% en AutomationBench-AA, superando a Claude Fable 5, con un 48,6%, y a Claude Opus 4.8, con un 48,5%. El modelo también se impuso en precio: 0,34 dólares por tarea, frente a los 1,35 dólares de Fable 5 y los 1,46 dólares de Opus 4.8.
El benchmark aporta una validación externa a la afirmación de Musk de que Grok 4.5 es un modelo de clase Opus que corre más rápido y a menor coste. SpaceXAI abrió el modelo al público esta semana, apoyándose en una base V9 de 1,5 billones de parámetros y en evaluaciones internas preliminares para enmarcar el lanzamiento.
AutomationBench-AA agrupa 657 tareas en 40 aplicaciones simuladas, entre ellas Gmail, Slack, Salesforce y HubSpot. El test evalúa si un agente de IA logra completar los objetivos sin saltarse las barreras de seguridad, y Artificial Analysis mantiene el conjunto de tareas en privado para limitar la contaminación del benchmark.
También te puede interesar: Grok 4.5 desafía a OpenAI y Anthropic con una IA de agentes más barata
La apuesta de Musk
Según Artificial Analysis, Grok 4.5 utilizó unos 8.000 tokens de salida por tarea, aproximadamente una cuarta parte del total de Opus 4.8. “Su consumo total de tokens, 0,44 millones por tarea, está entre los más bajos del ranking”, indicó la firma, que atribuye el bajo coste a la eficiencia y a la estructura de precios por token.
El modelo completó el 79,9% de los objetivos y superó íntegramente el 21,9% de las tareas. En finanzas, el segmento más exigente del benchmark, Grok 4.5 lideró con un 71%, frente al 64% de Fable 5 y el 62% de Opus 4.8.
Su talón de Aquiles fue el cumplimiento normativo. Grok 4.5 registró 0,63 infracciones de guardrails por tarea, por encima de las 0,55 de Opus 4.8 y de las 0,46 de Gemini 3.5 Flash de Google, una diferencia relevante para empresas que despliegan agentes cerca de sistemas financieros en producción.
El mensaje de lanzamiento de Musk se centró en un compromiso práctico más que en una victoria limpia en todos los frentes. Grok 4.5 ya cuenta con un aval externo en coste y velocidad, pero su mayor tasa de violaciones de normas explica por qué la adopción corporativa seguirá dependiendo de la fiabilidad.
Próxima lectura: La recuperación de Bitcoin tiene un problema de demanda que los alcistas no pueden ignorar





