Grok 4.5 випереджає Fable 5 та Opus 4.8 у тесті агентів із результатом 51,4%

Grok 4.5 випереджає Fable 5 та Opus 4.8 у тесті агентів із результатом 51,4%

Grok 4.5 дав нові аргументи на користь заяв Ілона Маска про співвідношення ціни та якості, після того як у незалежному бенчмарку агентів модель вийшла в лідери.

Ключові тези:

  • Grok 4.5 набрав 51,4% в AutomationBench-AA, випередивши дві моделі Claude.
  • Вартість виконання одного завдання — $0,34, що суттєво нижче за найближчих конкурентів від Anthropic.
  • Підвищена частота порушення обмежень лишається ризиком для розгортання агентів у корпоративному середовищі.

Бенчмарк Grok

Artificial Analysis повідомила, що Grok 4.5 набрав 51,4% в AutomationBench-AA, випередивши Claude Fable 5 із 48,6% та Claude Opus 4.8 із 48,5%. Вартість виконання одного завдання для Grok 4.5 становила $0,34, тоді як для Fable 5 — $1,35, а для Opus 4.8 — $1,46.

Цей бенчмарк дає зовнішню перевірку заяв Маска, що Grok 4.5 — це модель рівня Opus, яка працює швидше та коштує дешевше. SpaceXAI відкрила доступ до моделі цього тижня, спираючись на базову модель V9 із 1,5 трлн параметрів і ранні внутрішні оцінки при запуску.

AutomationBench-AA охоплює 657 завдань у 40 змодельованих застосунках, серед яких Gmail, Slack, Salesforce та HubSpot. Тест оцінює, чи здатен AI-агент виконувати цілі, не порушуючи вбудованих обмежень, а Artificial Analysis зберігає набір завдань закритим, щоб уникати «зараження» бенчмарку.

До теми: Grok 4.5 кидає виклик OpenAI та Anthropic за рахунок дешевших агентних рішень

Смілива ставка Маска

За даними Artificial Analysis, Grok 4.5 використовував близько 8 000 вихідних токенів на завдання — приблизно чверть обсягу Opus 4.8. «Його загальне використання токенів на рівні 0,44 млн на завдання — одне з найнижчих у рейтингу», — зазначила компанія, додавши, що низька ціна досягається поєднанням ефективності та тарифів на токени.

Модель виконала 79,9% поставлених цілей і повністю завершила 21,9% завдань. У фінансовій сфері, яка вважається найскладнішим доменом бенчмарку, Grok 4.5 став лідером із результатом 71% проти 64% у Fable 5 та 62% в Opus 4.8.

Слабким місцем лишається комплаєнс. На кожне завдання в Grok 4.5 припадало в середньому 0,63 порушення обмежень, тоді як у Opus 4.8 цей показник становив 0,55, а в Gemini 3.5 Flash від Google — 0,46. Для компаній, що запускають агентів поруч із реальними фінансовими системами, така різниця має принципове значення.

Запускова презентація Маска робила ставку не на ідеальне домінування в усіх метриках, а на практичний компроміс. Grok 4.5 тепер має незалежне підтвердження переваг у вартості та швидкості, однак підвищений рівень порушень правил демонструє, чому корпоративне впровадження й надалі залежатиме від надійності.

Читайте також: Відновлення Bitcoin стикається з проблемою попиту, яку «бики» ігнорують на свій ризик

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Grok 4.5 випереджає Fable 5 та Opus 4.8 у тесті агентів із результатом 51,4% | Yellow