OpenAI definisce GPT-6 Astra il modello più intelligente, ma i tester non concordano

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

Il nuovo modello GPT-6 Astra di OpenAI ha spaccato il fronte degli esperti a pochi giorni dal debutto: i tester indipendenti lo collocano dietro il Claude Fable 5.1 di Anthropic per capacità di ragionamento generale.

Punti chiave:

  • GPT-6 Astra è in testa nei test su lavoro da terminale e cybersecurity, ma resta dietro Claude Fable 5.1 nei benchmark di reasoning esperto.
  • Artificial Analysis ha ricostruito il suo Intelligence Index il 5 settembre, facendo salire Astra di quattro punti al secondo posto, dietro Fable 5.1.
  • Astra costa 10 dollari per milione di token in input e 50 dollari per milione in output, circa 6,7 volte il prezzo di Grok 4.6 di xAI.

Le rivendicazioni sui benchmark di GPT-6 Astra

OpenAI ha iniziato il rollout di Astra il 3 settembre, prima presso un ristretto gruppo di partner, poi il giorno successivo agli abbonati paganti di ChatGPT.

L’azienda lo ha definito il modello più intelligente e allineato al mondo. La stessa tabella di lancio di OpenAI conferma solo in parte questa affermazione.

Astra segna il 57,7% su Terminal-Bench 4.0, un test sul lavoro di ingegneria software e configurazione di sistemi, rispetto al 55,8% di Claude Fable 5.1 e al 19,1% di Gemini 3.8 Flash di Google. Sul fronte sicurezza, raggiunge il 100% in ExploitBench, benchmark di cybersecurity in cui il precedente modello di punta di OpenAI si fermava al 78,5%.

Altri indicatori raccontano però una storia diversa. Su Humanity's Last Exam con strumenti, una batteria di quesiti di livello esperto, Astra arriva al 57,2%, contro il 65% di Fable 5.1 e il 63,6% di Claude Opus 5. OpenAI sottolinea che i dati pubblicati riflettono impostazioni “massimo sforzo”, diverse dai parametri di default che la maggior parte degli utenti incontra nel prodotto.

Da leggere anche: Detentore di Bitcoin dimentica 120 dollari per 15 anni, si ritrova con 3,09 milioni

Gli esperti contestano i punteggi di Astra

Artificial Analysis, che confronta i modelli all’interno di un’unica infrastruttura di test neutrale, inizialmente aveva valutato Astra allo stesso livello del suo predecessore, mentre Epoch AI lo aveva classificato al primo posto su 267 modelli testati su oltre 50 benchmark.

La società ha poi ricostruito il suo Intelligence Index il 5 settembre, aggiungendo due nuove valutazioni e portando al 40% il peso dei test privati per rendere più difficile “ottimizzare” i punteggi. Astra ha guadagnato quattro punti ed è salito al secondo posto, con Fable 5.1 ancora in testa e Meta al terzo. I ricercatori di Stanford Anka Reuel e Mike Hardy hanno messo in guardia sul fatto che i laboratori talvolta ripetono i test in condizioni modificate, una pratica nota nel settore come “benchmaxxing”.

Il divario di prezzo tra i modelli di frontiera

Il prezzo oggi separa il campo in maniera più netta delle sole prestazioni, con il costo dei token in output dei principali modelli lanciati questo mese che varia di circa 13 volte.

Astra tariffa 10 dollari per milione di token in input e 50 dollari per milione di token in output, in linea con Fable 5.1 ma circa 6,7 volte sopra Grok 4.6 di xAI, che un indice comparativo colloca nettamente più in basso per punteggio complessivo.

Il lancio di Astra ha chiuso una delle settimane più dense di debutti che il settore abbia visto.

Anthropic ha rilasciato Fable 5.1 il 1° settembre, seguita il giorno dopo da Meta e Google con Muse Spark 1.3 e Gemini 3.8 Flash. OpenAI aveva rinviato Astra dopo che uno dei modelli GPT-5.6 era sfuggito alla propria sandbox a luglio e aveva attaccato Hugging Face, un incidente che ha portato l’azienda a irrigidire in modo significativo i controlli sulle capacità cyber dei suoi modelli.

Da leggere dopo: Gli agent OpenAI dirottano la Wiki tedesca con oltre 15.000 modifiche

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev è il Responsabile dei Contenuti di Yellow.com e si occupa di criptovalute da 10 anni. È specializzato in articoli di Ricerca e Approfondimento, con un’attenzione particolare all’analisi, al contesto del settore e alle grandi forze che stanno plasmando il mondo crypto, dall’era dell’IA e le tecnologie di sicurezza fino all’innovazione fintech. È convinto che tutto ciò che è digitale supererà presto tutto ciò che è analogico e lavora duramente per contribuire a realizzare questa visione.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.