Grok 4.5 supera Fable 5 e Opus 4.8 nei test sugli agenti AI con un punteggio del 51,4%

Grok 4.5 supera Fable 5 e Opus 4.8 nei test sugli agenti AI con un punteggio del 51,4%

Grok 4.5 offre nuovo sostegno alle affermazioni di Elon Musk su costi e performance, dopo che un benchmark indipendente sugli agenti ha classificato il modello al primo posto.

Punti chiave:

  • Grok 4.5 ha ottenuto il 51,4% su AutomationBench-AA, davanti a due modelli Claude.
  • Il costo per task è di 0,34 dollari, molto inferiore ai principali rivali di Anthropic.
  • Il tasso più elevato di violazioni delle regole resta un fattore di rischio per l’adozione enterprise.

Il benchmark su Grok

Artificial Analysis ha riportato che Grok 4.5 ha totalizzato il 51,4% su AutomationBench-AA, superando Claude Fable 5 con il 48,6% e Claude Opus 4.8 con il 48,5%. Il modello costa inoltre 0,34 dollari per task, contro 1,35 dollari per Fable 5 e 1,46 dollari per Opus 4.8.

Il benchmark fornisce una validazione esterna alla tesi di Musk secondo cui Grok 4.5 è un modello di classe Opus, ma più veloce e meno costoso. SpaceXAI ha reso il modello disponibile al pubblico questa settimana, basandosi su una foundation V9 da 1,5 trilioni di parametri e su prime valutazioni interne per impostarne il lancio.

AutomationBench-AA comprende 657 task su 40 app simulate, tra cui Gmail, Slack, Salesforce e HubSpot. Il test misura la capacità di un agente AI di portare a termine gli obiettivi senza violare i guardrail; Artificial Analysis mantiene privata la batteria di task per ridurre il rischio di “contaminazione” del benchmark.

Vedi anche: Grok 4.5 sfida OpenAI e Anthropic con agenti AI più economici

La scommessa di Musk

Secondo Artificial Analysis, Grok 4.5 ha utilizzato circa 8.000 token di output per task, circa un quarto del consumo di Opus 4.8. “Il suo utilizzo totale di 0,44 milioni di token per task è tra i più bassi in classifica”, ha osservato la società, aggiungendo che il costo contenuto deriva da una combinazione di efficienza e pricing dei token.

Il modello ha completato il 79,9% degli obiettivi e ha superato integralmente il 21,9% dei task. Nel segmento finance, considerato il più complesso del benchmark, Grok 4.5 è in testa con il 71%, contro il 64% di Fable 5 e il 62% di Opus 4.8.

Il tallone d’Achille è la compliance. Grok 4.5 ha registrato in media 0,63 violazioni dei guardrail per task, più di Opus 4.8 (0,55) e di Gemini 3.5 Flash di Google (0,46). Un divario che pesa per le aziende che intendono usare agenti a ridosso di sistemi finanziari reali.

Il pitch di lancio di Musk ha insistito su un compromesso pratico, più che su un dominio netto dei benchmark. Grok 4.5 dispone ora di un riscontro indipendente su costi e velocità, ma l’elevato tasso di violazioni delle regole evidenzia perché l’adozione enterprise continuerà a dipendere dalla sua affidabilità.

Da leggere dopo: Il recupero di Bitcoin ha un problema di domanda che i tori non possono ignorare

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
Grok 4.5 supera Fable 5 e Opus 4.8 nei test sugli agenti AI con un punteggio del 51,4% | Yellow