Grok 4.5 wyprzedza Fable 5 i Opus 4.8 w teście agentów AI z wynikiem 51,4%

Grok 4.5 wyprzedza Fable 5 i Opus 4.8 w teście agentów AI z wynikiem 51,4%

Grok 4.5 dostarczył Elonowi Muskowi nowych argumentów na rzecz relacji koszt–wydajność. Niezależny benchmark agentów AI uplasował ten model na pierwszym miejscu.

Najważniejsze wnioski:

  • Grok 4.5 uzyskał 51,4% w teście AutomationBench-AA, wyprzedzając dwa modele Claude.
  • Koszt wykonania zadania wyniósł 0,34 dolara, znacznie mniej niż u najbliższych rywali od Anthropic.
  • Wyższy od konkurentów poziom naruszeń zasad bezpieczeństwa pozostaje istotnym ryzykiem przy wdrożeniach korporacyjnych agentów.

Benchmark Groka

Artificial Analysis podała, że Grok 4.5 uzyskał 51,4% w AutomationBench-AA, wyprzedzając Claude Fable 5 z wynikiem 48,6% oraz Claude Opus 4.8 z rezultatem 48,5%. Koszt wykonania pojedynczego zadania wyniósł 0,34 dolara, wobec 1,35 dolara dla Fable 5 i 1,46 dolara dla Opus 4.8.

Benchmark stanowi zewnętrzne potwierdzenie tezy Muska, że Grok 4.5 to model klasy Opus, działający szybciej i taniej. SpaceXAI udostępnił model publicznie w tym tygodniu, opierając go na bazowym modelu V9 z 1,5 bln parametrów i wczesnych wewnętrznych testach.

AutomationBench-AA obejmuje 657 zadań w 40 symulowanych aplikacjach, m.in. Gmail, Slack, Salesforce i HubSpot. Test sprawdza, czy agent AI potrafi realizować cele bez naruszania guardrailów, a Artificial Analysis utrzymuje zestaw zadań w tajemnicy, by ograniczyć „uciekanie” danych benchmarkowych do treningu modeli.

Zobacz też: Grok 4.5 rzuca wyzwanie OpenAI i Anthropic tańszą agentową AI

Odważna teza Muska

Artificial Analysis poinformowała, że Grok 4.5 generował ok. 8 tys. tokenów wyjściowych na zadanie, czyli około jedną czwartą zużycia Opus 4.8. „Jego łączne zużycie 0,44 mln tokenów na zadanie jest jednym z najniższych w tabeli wyników” – podkreśliła firma, dodając, że niski koszt to efekt zarówno efektywności, jak i cen tokenów.

Model zrealizował 79,9% celów zadaniowych i w pełni zaliczył 21,9% zadań. W segmencie finansów – najtrudniejszej kategorii benchmarku – Grok 4.5 był liderem z wynikiem 71%, wobec 64% dla Fable 5 i 62% dla Opus 4.8.

Słabym punktem pozostaje zgodność z zasadami. Grok 4.5 notował średnio 0,63 naruszenia guardrailów na zadanie, powyżej 0,55 dla Opus 4.8 i 0,46 dla Gemini 3.5 Flash od Google. Ta różnica ma znaczenie dla firm wdrażających agentów w otoczeniu rzeczywistych systemów finansowych.

Narracja Muska przy premierze podkreślała raczej praktyczny kompromis niż bezdyskusyjną dominację w benchmarkach. Grok 4.5 ma już zewnętrzne potwierdzenie przewagi kosztowej i szybkości, ale wyższa liczba naruszeń zasad pokazuje, że w segmencie enterprise kluczowa pozostanie niezawodność.

Czytaj dalej: Bitcoinowa korekta: problem popytowy, którego byki nie mogą zignorować

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Grok 4.5 wyprzedza Fable 5 i Opus 4.8 w teście agentów AI z wynikiem 51,4% | Yellow