Grok 4.5 получил новую фактическую поддержку тезиса Илона Маска о соотношении цены и производительности: в независимом бенчмарке агентных моделей система заняла первое место.
Ключевые моменты:
- Grok 4.5 набрал 51,4% в AutomationBench-AA, опередив две модели Claude.
- Стоимость одного задания составила $0,34 — заметно ниже, чем у ближайших конкурентов от Anthropic.
- Повышенная частота нарушений правил остаётся риском для корпоративных внедрений агентных ИИ.
Бенчмарк Grok
Компания Artificial Analysis сообщила, что Grok 4.5 показал 51,4% в тесте AutomationBench-AA, обогнав Claude Fable 5 с 48,6% и Claude Opus 4.8 с 48,5%. При этом выполнение одного задания стоило $0,34 против $1,35 у Fable 5 и $1,46 у Opus 4.8.
Этот результат даёт внешнюю проверку заявлению Маска о том, что Grok 4.5 — модель класса Opus, но быстрее и дешевле. SpaceXAI вывела модель в публичный доступ на этой неделе, опираясь на базовую архитектуру V9 с 1,5 трлн параметров и предварительные внутренние оценки для позиционирования релиза.
AutomationBench-AA включает 657 задач в 40 моделируемых приложениях, среди которых Gmail, Slack, Salesforce и HubSpot. Тест проверяет, способен ли агентный ИИ достигать целей, не нарушая защитные ограничения, а Artificial Analysis не раскрывает полный набор заданий, чтобы снизить риск подгонки моделей под бенчмарк.
Также по теме: Grok 4.5 бросает вызов OpenAI и Anthropic с более дешёвым агентным ИИ
Смелое заявление Маска
По данным Artificial Analysis, Grok 4.5 в среднем генерировал около 8 000 выходных токенов на задачу — примерно четверть объёма Opus 4.8. «Суммарное использование токенов на уровне 0,44 млн на задачу — одно из самых низких в рейтинге», — отметила фирма, добавив, что низкая стоимость достигается за счёт эффективности и ценовой политики по токенам.
Модель смогла выполнить 79,9% поставленных целей и полностью пройти 21,9% задач. В сегменте финансов — самом сложном домене бенчмарка — Grok 4.5 лидировал с результатом 71% против 64% у Fable 5 и 62% у Opus 4.8.
Слабым местом стала комплаенс-составляющая. В среднем Grok 4.5 фиксировал 0,63 нарушения защитных правил на задачу — больше, чем Opus 4.8 с 0,55 и Gemini 3.5 Flash от Google с 0,46. Для компаний, использующих агентов рядом с реальными финансовыми контурами, такая разница критична.
Стартовая презентация Маска была сосредоточена на практическом компромиссе, а не на «чистой победе» в тестах. У Grok 4.5 теперь есть внешнее подтверждение преимуществ по стоимости и скорости, однако повышенный уровень нарушений правил подчёркивает, что масштабное корпоративное внедрение по-прежнему будет зависеть от надёжности.
Читайте далее: У восстановления биткоина есть проблемный спрос, который быкам нельзя игнорировать





