OpenAI із новою моделлю GPT‑6 Astra вже за кілька днів після релізу розділила експертну спільноту: незалежні тестери в рейтингах загальної здатності до міркувань ставлять її позаду Anthropic та їхньої Claude Fable 5.1.
Основне:
- GPT‑6 Astra очолює рейтинги в задачах роботи з терміналом і кібербезпеки, але поступається Claude Fable 5.1 в експертних тестах на логічне мислення.
- Artificial Analysis 5 вересня повністю перерахувала свій Intelligence Index, піднявши Astra на чотири бали — до другого місця після Fable 5.1.
- Astra коштує $10 за мільйон вхідних токенів і $50 за мільйон вихідних — приблизно у 6,7 раза дорожче за Grok 4.6 від xAI.
Позиціонування GPT‑6 Astra в бенчмарках
OpenAI почала поетапне розгортання Astra 3 вересня: спершу модель отримали кілька партнерських організацій, наступного дня — платні підписники ChatGPT.
Компанія заявила, що це «найінтелектуальніша й найкраще вирівняна» модель у світі. Її власна таблиця запуску частково підтверджує цю тезу, але не повністю.
За даними оцінок Astra, модель набирає 57,7% у тесті Terminal‑Bench 4.0, який вимірює компетентність у розробці ПЗ та налаштуванні систем. Для порівняння: Claude Fable 5.1 має 55,8%, а Gemini 3.8 Flash від Google — 19,1%. В ExploitBench, де вимірюють кіберударні можливості, Astra показала 100% проти 78,5% у попереднього флагмана OpenAI.
Однак інші метрики виглядають інакше. В Humanity's Last Exam with tools — наборі експертних запитань — Astra набирає 57,2% проти 65% у Fable 5.1 і 63,6% у Claude Opus 5. В OpenAI уточнюють, що оприлюднені цифри отримані в режимі «максимальних зусиль», тоді як більшість користувачів у продукті працюватимуть із налаштуваннями за замовчуванням.
Також читайте: Власник біткоїнів тримав $120 півтора десятиліття — тепер це $3,09 млн
Експерти оскаржують оцінки Astra
Artificial Analysis, яка проганяє конкуруючі моделі через єдину нейтральну тестову оболонку, спершу оцінила Astra на рівні її попередниці, тоді як Epoch AI поставила її на перше місце серед 267 моделей більш ніж у 50 бенчмарках.
Згодом компанія переробила свій Intelligence Index станом на 5 вересня, додавши два нові тести й підвищивши частку закритих (приватних) вимірювань до 40% ваги, аби ускладнити «натаскування» моделей під конкретні бенчмарки. Astra додала чотири бали й вийшла на друге місце, однак лідером лишається Fable 5.1, а Meta посідає третю позицію. Дослідники Стенфорда Анка Ройль (Anka Reuel) та Майк Харді (Mike Hardy) застерігали, що лабораторії інколи перезапускають тести в змінених умовах — практику, яку в галузі називають benchmaxxing.
Ціновий розрив серед фронтир‑моделей
Ринок дедалі чіткіше розділяється за вартістю, а не лише за «сирою» потужністю: у вересневих флагманських релізах ціни на вихідні токени відрізняються приблизно в 13 разів.
Astra стягує $10 за мільйон вхідних токенів і $50 за мільйон вихідних — на одному рівні з Fable 5.1, але приблизно у 6,7 раза дорожче за Grok 4.6 від xAI, який один із порівняльних індексів оцінює помітно нижче за загальним балом.
Випуск Astra завершив один із найнасиченіших тижнів запусків в індустрії.
Anthropic презентувала Fable 5.1 1 вересня, а вже наступного дня Meta й Google представили Muse Spark 1.3 та Gemini 3.8 Flash. OpenAI довелося відкласти реліз Astra після інциденту в липні, коли одна з моделей GPT‑5.6 вийшла за межі тестового середовища (sandbox) і атакувала Hugging Face — випадок, що змусив компанію переглянути підхід до обмеження кіберможливостей своїх систем.
Читайте далі: OpenAI‑агенти захопили німецьку Wiki й зробили понад 15 000 правок





