Grok 4.5 та GPT-5.6 вийшли з різницею в один день і миттєво розділили спільноту оглядачів: OpenAI показує 91,9% у «агентному» кодуванні, тоді як SpaceXAI кидає виклик «фронтирним» тарифам ставкою $2 за мільйон токенів.
Ключові акценти:
- GPT-5.6 Sol лідирує в більшості прямих бенчмарків, тоді як Grok 4.5 агресивно демпінгує за ціною, швидкістю й економністю токенів.
- Незалежні тестери ставлять Grok 4.5 лише на четверте місце за інтелектом і фіксують подвоєння рівня галюцинацій — до 54%.
- Оглядачі обирають GPT-5.6 для написання текстів і довгих кодових прогонів, а Grok 4.5 — для масових задач із жорстким бюджетом.
Grok 4.5 проти GPT-5.6: що кажуть бенчмарки
SpaceXAI випустила Grok 4.5 8 липня. Уже наступного дня OpenAI відповіла лінійкою GPT-5.6, де флагманський Sol доповнюють дешевші рівні Terra та Luna. Бенчмарк-фірма Artificial Analysis розмістила оновлений Grok лише четвертим в Index of Intelligence із 54 балами — позаду Claude Fable 5, GPT-5.5 та Opus 4.8.
У прямому ж протистоянні перевага — за OpenAI. Одна з проміжних таблиць результатів оцінює GPT-5.6 Sol у 86 балів проти 82 у Grok 4.5. Розрив формують насамперед «термінальні» агентні задачі: 91,9% проти 83,3%, тоді як середні результати в кодуванні майже рівні — 64,7 проти 64,6.
За даними OpenAI, компанія заявляє, що Sol із максимальними налаштуваннями на «reasoning» ставить рекорд у 80 балів в незалежному Coding Agent Index. Grok 4.5 там же набирає 76 балів у власному середовищі Grok Build. Але економіка працює в інший бік: Grok бере по $2 за мільйон вхідних токенів проти $5 у Sol, а закінчена кодова задача обходиться в $2,49 — проти $11,80 для Fable 5.
Також читайте: Ставки на Dodgers сягнули $68 млн, поки Polymarket і Kalshi роблять ставку на плей-оф MLB
Кодування, тексти й рутина
Практичні звіти підтверджують цю ж дихотомію. Один довготривалий тестовий стенд показав, що Sol без пробних помилок завершив 63,7% зі 100+ реальних задач у Git-репозиторіях, не гублячись у складних багатокрокових чеклістах. Інший незалежний тест кодування оцінив Sol у 92 зі 100 балів, а Grok 4.5 — у 87, на рівні найсильніших моделей з відкритими вагами.
Автори текстів також тяжіють до OpenAI: ранні тестувальники описують Sol як «щоденного робочого коня», який уже покриває близько 80% типової інтелектуальної рутини й точніше за конкурентів тримається редакційних гайдів.
Відповідь Grok 4.5 — швидкість і дисципліна. Оглядачі, які проганяли модель на реальних замовленнях, фіксують якісні результати з першої спроби, надійний структурований вивід і час відповіді до п’яти секунд при швидкості близько 80 токенів за секунду. Проблема — в точності: зафіксований рівень галюцинацій підскочив із 25% до 54%, навіть попри те, що фактична точність підросла до 52%.
Вердикти експертів та питання довіри
Ілон Маск презентував Grok 4.5 як «модель класу Opus, але швидшу, ефективнішу за токенами й дешевшу». Частина аналітиків вважає, що ціновий розрив важливіший за бенчмарк-розрив, адже Grok витрачає в середньому 1,9 млн токенів на задачу проти 7,2 млн у Fable 5.
Скептики бачать приводи для обережності. Оглядачі звертають увагу, що стартові показники були надані самим вендором, модельна картка не оприлюднена, а Cursor відкликав один із власних внутрішніх бенчмарків після того, як виявилося, що Grok випадково тренувався на його кодовій базі. GPT-5.6 теж іде з «зірочкою»: системна картка OpenAI визнає, що нова модель частіше за попередницю порушує інструкції користувача.
Суперництво підсумувало й без того буремний період на ринку ШІ. SpaceX поглинула xAI у лютому, у червні купила Cursor за $60 млрд і за два дні до релізу Grok 4.5 ребрендувала лабораторію в SpaceXAI. OpenAI наприкінці червня тримала Sol під урядовим переглядом, тоді як Fable 5 від Anthropic, що досі очолює опубліковані бенчмарки, повернулася до роботи лише 1 липня після 19-денного простою.
Читайте далі: Ethereum наздоганяє Bitcoin, перевіряючи «бичачий» сценарій Тома Лі на 2026 рік






