GPT-5.6 или Grok 4.5? Эксперты объясняют, что на самом деле даёт токен за $2

Reviewers weigh OpenAI's new flagship model against SpaceXAI's budget challenger after both launched a day apart in July. (Image: Shutterstock)
Reviewers weigh OpenAI's new flagship model against SpaceXAI's budget challenger after both launched a day apart in July. (Image: Shutterstock)

Grok 4.5 и GPT-5.6 вышли с разницей в один день и мгновенно раскололи рынок: часть обозревателей делает ставку на агентский кодинговый результат OpenAI в 91,9%, другие — на вызов SpaceXAI с ценой $2 за миллион токенов на фоне премиального сегмента.

Ключевые тезисы:

  • GPT-5.6 Sol выигрывает большинство прямых бенчмарков, тогда как Grok 4.5 агрессивно демпингует по цене, скорости и расходу токенов.
  • Независимые тесты ставят Grok 4.5 лишь четвёртым по «интеллекту» и фиксируют рост доли галлюцинаций до 54%.
  • Обозреватели предпочитают GPT-5.6 для письма и длинных кодинговых прогонов, а Grok 4.5 — для массовых бюджетных задач.

Бенчмарки Grok 4.5 против GPT-5.6

SpaceXAI представила Grok 4.5 8 июля. OpenAI ответила на следующий день GPT-5.6 — линейкой, где флагман Sol дополнен более доступными Terra и Luna. Бенчмаркинговая фирма Artificial Analysis поставила новый Grok на четвёртое место в своём Intelligence Index с 54 баллами — позади Claude Fable 5, GPT-5.5 и Opus 4.8.

В прямом сравнении перевес у OpenAI. Один из промежуточных сводных рейтингов оценивает GPT-5.6 Sol в 86 баллов против 82 у Grok 4.5. Разрыв формируют прежде всего терминальные агентские задания: 91,9% против 83,3%, тогда как средние показатели по кодингу почти идентичны — 64,7 против 64,6.

По данным OpenAI, Sol в режиме максимального рассуждения устанавливает рекорд в 80 баллов в независимом Coding Agent Index; Grok 4.5 внутри фреймворка Grok Build набирает 76. Экономика, однако, работает в пользу SpaceXAI: Grok берёт $2 за миллион входных токенов против $5 у Sol, а завершённая кодинговая задача обходится в $2,49 против $11,80 у Fable 5.

Читайте также: Ставки на Dodgers достигли $68 млн, пока Polymarket и Kalshi делают ставку на плей-офф MLB

Кодинг, генерация текста и повседневные сценарии

Практические тесты показывают схожую развилку. Долгий «боевой» прогон показал, что Sol без ошибок по ходу эксперимента довёл до конца 63,7% из более чем 100 реальных задач в репозиториях, не теряя контекст в запутанных многошаговых чек-листах. В отдельном независимом кодинговом тесте Sol набрал 92 балла из 100, а Grok 4.5 — 87, что сопоставимо с лучшими моделями с открытыми весами.

Авторы и редакторы тоже склоняются к OpenAI: ранние пользователи описывают Sol как «ежедневного рабочего коня», который уже покрывает около 80% типичных задач знаний и заметно аккуратнее конкурентов соблюдает редакционные гайды и фирменный стиль.

Ответ Grok 4.5 — скорость и дисциплина. Рецензенты, прогнавшие модель на реальных задачах, сообщают о чистых сборках с первого раза, устойчивой структурированной выдаче и времени ответа менее пяти секунд при пропускной способности порядка 80 токенов в секунду. Проблема — надёжность: измеряемый уровень галлюцинаций вырос с 25% до 54%, хотя фактическая точность улучшилась до 52%.

Вердикты экспертов и вопрос доверия

Илон Маск представил Grok 4.5 как «модель класса Opus, но быстрее, экономичнее по токенам и дешевле». Часть аналитиков считает, что ценовой разрыв перевешивает отставание в бенчмарках, поскольку Grok сжигает около 1,9 млн токенов на задачу против 7,2 млн у Fable 5.

Скептики, однако, видят поводы для осторожности. Обозреватели отмечают, что стартовые оценки в значительной степени были заявлены самими вендорами, модельная карточка так и не вышла, а Cursor отозвала один из внутренних бенчмарков после того, как Grok по ошибке обучили на её кодовой базе. У GPT-5.6 тоже есть сноска: в системной карте OpenAI признаёт, что новая версия чаще, чем предшественник, выходит за рамки инструкций.

Противостояние венчало бурный период на рынке. SpaceX в феврале поглотила xAI, в июне купила Cursor за $60 млрд и за два дня до релиза Grok 4.5 переименовала лабораторию в SpaceXAI. OpenAI к концу июня держала Sol «на стопе» в связи с госрегуляторной проверкой, тогда как Fable 5 от Anthropic, сохраняющий статус лидера по опубликованным метрикам, вернулся в строй лишь 1 июля после 19-дневной приостановки.

Далее по теме: Ethereum обгоняет Bitcoin, проверяя бычий прогноз Тома Ли на 2026 год

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий мир криптовалют на протяжении последних 10 лет. Он специализируется на глубоких исследовательских материалах и обучающих статьях с упором на аналитическую подачу, отраслевой контекст и глобальные силы, формирующие крипторынок — от эры искусственного интеллекта и технологий безопасности до инноваций в финтехе. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
GPT-5.6 или Grok 4.5? Эксперты объясняют, что на самом деле даёт токен за $2 | Yellow