Grok 4.5 дав нові аргументи на користь заяв Ілона Маска про співвідношення ціни та якості, після того як у незалежному бенчмарку агентів модель вийшла в лідери.
Ключові тези:
- Grok 4.5 набрав 51,4% в AutomationBench-AA, випередивши дві моделі Claude.
- Вартість виконання одного завдання — $0,34, що суттєво нижче за найближчих конкурентів від Anthropic.
- Підвищена частота порушення обмежень лишається ризиком для розгортання агентів у корпоративному середовищі.
Бенчмарк Grok
Artificial Analysis повідомила, що Grok 4.5 набрав 51,4% в AutomationBench-AA, випередивши Claude Fable 5 із 48,6% та Claude Opus 4.8 із 48,5%. Вартість виконання одного завдання для Grok 4.5 становила $0,34, тоді як для Fable 5 — $1,35, а для Opus 4.8 — $1,46.
Цей бенчмарк дає зовнішню перевірку заяв Маска, що Grok 4.5 — це модель рівня Opus, яка працює швидше та коштує дешевше. SpaceXAI відкрила доступ до моделі цього тижня, спираючись на базову модель V9 із 1,5 трлн параметрів і ранні внутрішні оцінки при запуску.
AutomationBench-AA охоплює 657 завдань у 40 змодельованих застосунках, серед яких Gmail, Slack, Salesforce та HubSpot. Тест оцінює, чи здатен AI-агент виконувати цілі, не порушуючи вбудованих обмежень, а Artificial Analysis зберігає набір завдань закритим, щоб уникати «зараження» бенчмарку.
До теми: Grok 4.5 кидає виклик OpenAI та Anthropic за рахунок дешевших агентних рішень
Смілива ставка Маска
За даними Artificial Analysis, Grok 4.5 використовував близько 8 000 вихідних токенів на завдання — приблизно чверть обсягу Opus 4.8. «Його загальне використання токенів на рівні 0,44 млн на завдання — одне з найнижчих у рейтингу», — зазначила компанія, додавши, що низька ціна досягається поєднанням ефективності та тарифів на токени.
Модель виконала 79,9% поставлених цілей і повністю завершила 21,9% завдань. У фінансовій сфері, яка вважається найскладнішим доменом бенчмарку, Grok 4.5 став лідером із результатом 71% проти 64% у Fable 5 та 62% в Opus 4.8.
Слабким місцем лишається комплаєнс. На кожне завдання в Grok 4.5 припадало в середньому 0,63 порушення обмежень, тоді як у Opus 4.8 цей показник становив 0,55, а в Gemini 3.5 Flash від Google — 0,46. Для компаній, що запускають агентів поруч із реальними фінансовими системами, така різниця має принципове значення.
Запускова презентація Маска робила ставку не на ідеальне домінування в усіх метриках, а на практичний компроміс. Grok 4.5 тепер має незалежне підтвердження переваг у вартості та швидкості, однак підвищений рівень порушень правил демонструє, чому корпоративне впровадження й надалі залежатиме від надійності.
Читайте також: Відновлення Bitcoin стикається з проблемою попиту, яку «бики» ігнорують на свій ризик





