Grok 4.5 dostarczył Elonowi Muskowi nowych argumentów na rzecz relacji koszt–wydajność. Niezależny benchmark agentów AI uplasował ten model na pierwszym miejscu.
Najważniejsze wnioski:
- Grok 4.5 uzyskał 51,4% w teście AutomationBench-AA, wyprzedzając dwa modele Claude.
- Koszt wykonania zadania wyniósł 0,34 dolara, znacznie mniej niż u najbliższych rywali od Anthropic.
- Wyższy od konkurentów poziom naruszeń zasad bezpieczeństwa pozostaje istotnym ryzykiem przy wdrożeniach korporacyjnych agentów.
Benchmark Groka
Artificial Analysis podała, że Grok 4.5 uzyskał 51,4% w AutomationBench-AA, wyprzedzając Claude Fable 5 z wynikiem 48,6% oraz Claude Opus 4.8 z rezultatem 48,5%. Koszt wykonania pojedynczego zadania wyniósł 0,34 dolara, wobec 1,35 dolara dla Fable 5 i 1,46 dolara dla Opus 4.8.
Benchmark stanowi zewnętrzne potwierdzenie tezy Muska, że Grok 4.5 to model klasy Opus, działający szybciej i taniej. SpaceXAI udostępnił model publicznie w tym tygodniu, opierając go na bazowym modelu V9 z 1,5 bln parametrów i wczesnych wewnętrznych testach.
AutomationBench-AA obejmuje 657 zadań w 40 symulowanych aplikacjach, m.in. Gmail, Slack, Salesforce i HubSpot. Test sprawdza, czy agent AI potrafi realizować cele bez naruszania guardrailów, a Artificial Analysis utrzymuje zestaw zadań w tajemnicy, by ograniczyć „uciekanie” danych benchmarkowych do treningu modeli.
Zobacz też: Grok 4.5 rzuca wyzwanie OpenAI i Anthropic tańszą agentową AI
Odważna teza Muska
Artificial Analysis poinformowała, że Grok 4.5 generował ok. 8 tys. tokenów wyjściowych na zadanie, czyli około jedną czwartą zużycia Opus 4.8. „Jego łączne zużycie 0,44 mln tokenów na zadanie jest jednym z najniższych w tabeli wyników” – podkreśliła firma, dodając, że niski koszt to efekt zarówno efektywności, jak i cen tokenów.
Model zrealizował 79,9% celów zadaniowych i w pełni zaliczył 21,9% zadań. W segmencie finansów – najtrudniejszej kategorii benchmarku – Grok 4.5 był liderem z wynikiem 71%, wobec 64% dla Fable 5 i 62% dla Opus 4.8.
Słabym punktem pozostaje zgodność z zasadami. Grok 4.5 notował średnio 0,63 naruszenia guardrailów na zadanie, powyżej 0,55 dla Opus 4.8 i 0,46 dla Gemini 3.5 Flash od Google. Ta różnica ma znaczenie dla firm wdrażających agentów w otoczeniu rzeczywistych systemów finansowych.
Narracja Muska przy premierze podkreślała raczej praktyczny kompromis niż bezdyskusyjną dominację w benchmarkach. Grok 4.5 ma już zewnętrzne potwierdzenie przewagi kosztowej i szybkości, ale wyższa liczba naruszeń zasad pokazuje, że w segmencie enterprise kluczowa pozostanie niezawodność.
Czytaj dalej: Bitcoinowa korekta: problem popytowy, którego byki nie mogą zignorować





