OpenAI назвала GPT‑6 Astra найрозумнішою моделлю, але тестувальники не згодні

OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)
OpenAI's GPT-6 Astra posts record launch scores yet sits behind Anthropic's Claude Fable 5.1 in independent reasoning tests. (Image: Shutterstock)

OpenAI із новою моделлю GPT‑6 Astra вже за кілька днів після релізу розділила експертну спільноту: незалежні тестери в рейтингах загальної здатності до міркувань ставлять її позаду Anthropic та їхньої Claude Fable 5.1.

Основне:

  • GPT‑6 Astra очолює рейтинги в задачах роботи з терміналом і кібербезпеки, але поступається Claude Fable 5.1 в експертних тестах на логічне мислення.
  • Artificial Analysis 5 вересня повністю перерахувала свій Intelligence Index, піднявши Astra на чотири бали — до другого місця після Fable 5.1.
  • Astra коштує $10 за мільйон вхідних токенів і $50 за мільйон вихідних — приблизно у 6,7 раза дорожче за Grok 4.6 від xAI.

Позиціонування GPT‑6 Astra в бенчмарках

OpenAI почала поетапне розгортання Astra 3 вересня: спершу модель отримали кілька партнерських організацій, наступного дня — платні підписники ChatGPT.

Компанія заявила, що це «найінтелектуальніша й найкраще вирівняна» модель у світі. Її власна таблиця запуску частково підтверджує цю тезу, але не повністю.

За даними оцінок Astra, модель набирає 57,7% у тесті Terminal‑Bench 4.0, який вимірює компетентність у розробці ПЗ та налаштуванні систем. Для порівняння: Claude Fable 5.1 має 55,8%, а Gemini 3.8 Flash від Google — 19,1%. В ExploitBench, де вимірюють кіберударні можливості, Astra показала 100% проти 78,5% у попереднього флагмана OpenAI.

Однак інші метрики виглядають інакше. В Humanity's Last Exam with tools — наборі експертних запитань — Astra набирає 57,2% проти 65% у Fable 5.1 і 63,6% у Claude Opus 5. В OpenAI уточнюють, що оприлюднені цифри отримані в режимі «максимальних зусиль», тоді як більшість користувачів у продукті працюватимуть із налаштуваннями за замовчуванням.

Також читайте: Власник біткоїнів тримав $120 півтора десятиліття — тепер це $3,09 млн

Експерти оскаржують оцінки Astra

Artificial Analysis, яка проганяє конкуруючі моделі через єдину нейтральну тестову оболонку, спершу оцінила Astra на рівні її попередниці, тоді як Epoch AI поставила її на перше місце серед 267 моделей більш ніж у 50 бенчмарках.

Згодом компанія переробила свій Intelligence Index станом на 5 вересня, додавши два нові тести й підвищивши частку закритих (приватних) вимірювань до 40% ваги, аби ускладнити «натаскування» моделей під конкретні бенчмарки. Astra додала чотири бали й вийшла на друге місце, однак лідером лишається Fable 5.1, а Meta посідає третю позицію. Дослідники Стенфорда Анка Ройль (Anka Reuel) та Майк Харді (Mike Hardy) застерігали, що лабораторії інколи перезапускають тести в змінених умовах — практику, яку в галузі називають benchmaxxing.

Ціновий розрив серед фронтир‑моделей

Ринок дедалі чіткіше розділяється за вартістю, а не лише за «сирою» потужністю: у вересневих флагманських релізах ціни на вихідні токени відрізняються приблизно в 13 разів.

Astra стягує $10 за мільйон вхідних токенів і $50 за мільйон вихідних — на одному рівні з Fable 5.1, але приблизно у 6,7 раза дорожче за Grok 4.6 від xAI, який один із порівняльних індексів оцінює помітно нижче за загальним балом.

Випуск Astra завершив один із найнасиченіших тижнів запусків в індустрії.

Anthropic презентувала Fable 5.1 1 вересня, а вже наступного дня Meta й Google представили Muse Spark 1.3 та Gemini 3.8 Flash. OpenAI довелося відкласти реліз Astra після інциденту в липні, коли одна з моделей GPT‑5.6 вийшла за межі тестового середовища (sandbox) і атакувала Hugging Face — випадок, що змусив компанію переглянути підхід до обмеження кіберможливостей своїх систем.

Читайте далі: OpenAI‑агенти захопили німецьку Wiki й зробили понад 15 000 правок

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптовалютну тематику вже 10 років. Він спеціалізується на поглиблених матеріалах формату Research та Learn, зосереджених на аналітичній подачі, галузевому контексті та глобальних силах, що формують крипторинок — від епохи штучного інтелекту й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром остаточно переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
OpenAI назвала GPT‑6 Astra найрозумнішою моделлю, але тестувальники не згодні | Yellow