Grok 4.5 обходит Fable 5 и Opus 4.8 в тесте агентных ИИ с результатом 51,4%

Grok 4.5 обходит Fable 5 и Opus 4.8 в тесте агентных ИИ с результатом 51,4%

Grok 4.5 получил новую фактическую поддержку тезиса Илона Маска о соотношении цены и производительности: в независимом бенчмарке агентных моделей система заняла первое место.

Ключевые моменты:

  • Grok 4.5 набрал 51,4% в AutomationBench-AA, опередив две модели Claude.
  • Стоимость одного задания составила $0,34 — заметно ниже, чем у ближайших конкурентов от Anthropic.
  • Повышенная частота нарушений правил остаётся риском для корпоративных внедрений агентных ИИ.

Бенчмарк Grok

Компания Artificial Analysis сообщила, что Grok 4.5 показал 51,4% в тесте AutomationBench-AA, обогнав Claude Fable 5 с 48,6% и Claude Opus 4.8 с 48,5%. При этом выполнение одного задания стоило $0,34 против $1,35 у Fable 5 и $1,46 у Opus 4.8.

Этот результат даёт внешнюю проверку заявлению Маска о том, что Grok 4.5 — модель класса Opus, но быстрее и дешевле. SpaceXAI вывела модель в публичный доступ на этой неделе, опираясь на базовую архитектуру V9 с 1,5 трлн параметров и предварительные внутренние оценки для позиционирования релиза.

AutomationBench-AA включает 657 задач в 40 моделируемых приложениях, среди которых Gmail, Slack, Salesforce и HubSpot. Тест проверяет, способен ли агентный ИИ достигать целей, не нарушая защитные ограничения, а Artificial Analysis не раскрывает полный набор заданий, чтобы снизить риск подгонки моделей под бенчмарк.

Также по теме: Grok 4.5 бросает вызов OpenAI и Anthropic с более дешёвым агентным ИИ

Смелое заявление Маска

По данным Artificial Analysis, Grok 4.5 в среднем генерировал около 8 000 выходных токенов на задачу — примерно четверть объёма Opus 4.8. «Суммарное использование токенов на уровне 0,44 млн на задачу — одно из самых низких в рейтинге», — отметила фирма, добавив, что низкая стоимость достигается за счёт эффективности и ценовой политики по токенам.

Модель смогла выполнить 79,9% поставленных целей и полностью пройти 21,9% задач. В сегменте финансов — самом сложном домене бенчмарка — Grok 4.5 лидировал с результатом 71% против 64% у Fable 5 и 62% у Opus 4.8.

Слабым местом стала комплаенс-составляющая. В среднем Grok 4.5 фиксировал 0,63 нарушения защитных правил на задачу — больше, чем Opus 4.8 с 0,55 и Gemini 3.5 Flash от Google с 0,46. Для компаний, использующих агентов рядом с реальными финансовыми контурами, такая разница критична.

Стартовая презентация Маска была сосредоточена на практическом компромиссе, а не на «чистой победе» в тестах. У Grok 4.5 теперь есть внешнее подтверждение преимуществ по стоимости и скорости, однако повышенный уровень нарушений правил подчёркивает, что масштабное корпоративное внедрение по-прежнему будет зависеть от надёжности.

Читайте далее: У восстановления биткоина есть проблемный спрос, который быкам нельзя игнорировать

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
Grok 4.5 обходит Fable 5 и Opus 4.8 в тесте агентных ИИ с результатом 51,4% | Yellow