Grok 4.5 и GPT-5.6 вышли с разницей в один день и мгновенно раскололи рынок: часть обозревателей делает ставку на агентский кодинговый результат OpenAI в 91,9%, другие — на вызов SpaceXAI с ценой $2 за миллион токенов на фоне премиального сегмента.
Ключевые тезисы:
- GPT-5.6 Sol выигрывает большинство прямых бенчмарков, тогда как Grok 4.5 агрессивно демпингует по цене, скорости и расходу токенов.
- Независимые тесты ставят Grok 4.5 лишь четвёртым по «интеллекту» и фиксируют рост доли галлюцинаций до 54%.
- Обозреватели предпочитают GPT-5.6 для письма и длинных кодинговых прогонов, а Grok 4.5 — для массовых бюджетных задач.
Бенчмарки Grok 4.5 против GPT-5.6
SpaceXAI представила Grok 4.5 8 июля. OpenAI ответила на следующий день GPT-5.6 — линейкой, где флагман Sol дополнен более доступными Terra и Luna. Бенчмаркинговая фирма Artificial Analysis поставила новый Grok на четвёртое место в своём Intelligence Index с 54 баллами — позади Claude Fable 5, GPT-5.5 и Opus 4.8.
В прямом сравнении перевес у OpenAI. Один из промежуточных сводных рейтингов оценивает GPT-5.6 Sol в 86 баллов против 82 у Grok 4.5. Разрыв формируют прежде всего терминальные агентские задания: 91,9% против 83,3%, тогда как средние показатели по кодингу почти идентичны — 64,7 против 64,6.
По данным OpenAI, Sol в режиме максимального рассуждения устанавливает рекорд в 80 баллов в независимом Coding Agent Index; Grok 4.5 внутри фреймворка Grok Build набирает 76. Экономика, однако, работает в пользу SpaceXAI: Grok берёт $2 за миллион входных токенов против $5 у Sol, а завершённая кодинговая задача обходится в $2,49 против $11,80 у Fable 5.
Читайте также: Ставки на Dodgers достигли $68 млн, пока Polymarket и Kalshi делают ставку на плей-офф MLB
Кодинг, генерация текста и повседневные сценарии
Практические тесты показывают схожую развилку. Долгий «боевой» прогон показал, что Sol без ошибок по ходу эксперимента довёл до конца 63,7% из более чем 100 реальных задач в репозиториях, не теряя контекст в запутанных многошаговых чек-листах. В отдельном независимом кодинговом тесте Sol набрал 92 балла из 100, а Grok 4.5 — 87, что сопоставимо с лучшими моделями с открытыми весами.
Авторы и редакторы тоже склоняются к OpenAI: ранние пользователи описывают Sol как «ежедневного рабочего коня», который уже покрывает около 80% типичных задач знаний и заметно аккуратнее конкурентов соблюдает редакционные гайды и фирменный стиль.
Ответ Grok 4.5 — скорость и дисциплина. Рецензенты, прогнавшие модель на реальных задачах, сообщают о чистых сборках с первого раза, устойчивой структурированной выдаче и времени ответа менее пяти секунд при пропускной способности порядка 80 токенов в секунду. Проблема — надёжность: измеряемый уровень галлюцинаций вырос с 25% до 54%, хотя фактическая точность улучшилась до 52%.
Вердикты экспертов и вопрос доверия
Илон Маск представил Grok 4.5 как «модель класса Opus, но быстрее, экономичнее по токенам и дешевле». Часть аналитиков считает, что ценовой разрыв перевешивает отставание в бенчмарках, поскольку Grok сжигает около 1,9 млн токенов на задачу против 7,2 млн у Fable 5.
Скептики, однако, видят поводы для осторожности. Обозреватели отмечают, что стартовые оценки в значительной степени были заявлены самими вендорами, модельная карточка так и не вышла, а Cursor отозвала один из внутренних бенчмарков после того, как Grok по ошибке обучили на её кодовой базе. У GPT-5.6 тоже есть сноска: в системной карте OpenAI признаёт, что новая версия чаще, чем предшественник, выходит за рамки инструкций.
Противостояние венчало бурный период на рынке. SpaceX в феврале поглотила xAI, в июне купила Cursor за $60 млрд и за два дня до релиза Grok 4.5 переименовала лабораторию в SpaceXAI. OpenAI к концу июня держала Sol «на стопе» в связи с госрегуляторной проверкой, тогда как Fable 5 от Anthropic, сохраняющий статус лидера по опубликованным метрикам, вернулся в строй лишь 1 июля после 19-дневной приостановки.
Далее по теме: Ethereum обгоняет Bitcoin, проверяя бычий прогноз Тома Ли на 2026 год






