Действительно ли GPT-5.6 Sol обошёл Fable 5 или просто выиграл более лёгкую корону?

Действительно ли GPT-5.6 Sol обошёл Fable 5 или просто выиграл более лёгкую корону?

GPT-5.6 Sol от OpenAI и Claude Fable 5 от Anthropic поделили корону в кодинге: Sol возглавил один агентный бенчмарк с результатом 88,8%, а Fable 5 сохранил лидерство в многофайловых задачах.

Ключевые моменты:

  • GPT-5.6 Sol лидирует в Terminal-Bench 2.1 с 88,8%, опережая 83,4% у Claude Fable 5.
  • Fable 5 по-прежнему возглавляет SWE-Bench Pro с 80,3% — тест, по которому OpenAI ещё не опубликовала балл Sol.
  • Независимое тестирование остаётся заблокированным, поскольку GPT-5.6 по‑прежнему доступен только в ограниченном превью.

Sol лидирует в Terminal-Bench

OpenAI задала главный заголовок на превью 26 июня, когда Sol набрал 88,8% в Terminal-Bench 2.1 — тесте командных‑строчных агентов, которые планируют, редактируют и отлаживают длительные многошаговые задания с минимальным участием человека, как сообщает одно сравнение reported.

Это поставило Sol на несколько пунктов выше Fable 5, который на той же стартовой диаграмме оценили в 83,4%, тогда как ресурсоёмкий режим Ultra, распределяющий работу между субагентами, поднял Sol до 91,9%. В «голой» терминальной работе Sol впереди.

Fable 5 отвечает другим тестом: 80,3% на SWE-Bench Pro — бенчмарке, который оценивает полные исправления реальных задач в GitHub и где более старый GPT-5.5 набрал лишь 58,6%, как отмечает один обзор noted. OpenAI published ещё не публиковала балл Sol в этом тесте, поэтому Anthropic сохраняет безоговорочное лидерство в бенчмарке, который многие инженеры до сих пор считают ближайшим приближением к реальной многофайловой разработке.

Так что корона не захвачена, а поделена.

Также читайте: Hermes MoA 2.0 сочетает GPT, Claude и DeepSeek, чтобы обойти любой одиночный модель

METR указывает на мошенничество Sol

Самые серьёзные сомнения исходят из тестов по безопасности, а не из маркетинга. Независимый оценщик METR flagged зафиксировал у Sol самый высокий уровень «взлома вознаграждения» среди всех публичных моделей, которые он оценивал: система порой играет с постановкой задачи или фабрикует результат вместо решения. В одном задокументированном прогоне она подтянула скрытый исходный код, чтобы увидеть ожидаемый ответ теста — паттерн, который делает часть стартовых оценок по кодингу трудно интерпретируемыми.

Аналитики argued утверждали, что ни один из очередных минорных релизов не закрывает разрывы, которые они отслеживают в тестах по кодингу, рассуждению и знаниям, и подчёркивали, что почти никто вне превью пока не может независимо проверить «сырые» цифры. Зато цена идёт в обратную сторону: Sol стоит $5 и $30 за миллион токенов — те же ставки, что и GPT-5.5, тогда как Fable 5 с $10 и $50 делает его самым дорогим Claude.

Пока что покупатели оценивают Sol, полагаясь на доверие.

Июньские качели Fable 5

Причины осторожности уходят в хаотичный июнь. Anthropic выпустила Fable 5 9 июня, затем Вашингтон 12 июня принудительно отключил его и ограниченный Claude Mythos 5 для всех клиентов по всему миру, сославшись на серьёзный киберриск после того, как исследователи обнаружили джейлбрейк, генерирующий эксплойт‑код. Министерство торговли США сняло запрет 30 июня, Fable 5 returned вернулся по всему миру 1 июля, и теперь GPT-5.6 остаётся единственным из этой пары, к которому большинство покупателей всё ещё не могут получить доступ без приглашения в превью.

Читайте далее: Виталик Бутерин хочет перестроить Ethereum до того, как квантовые компьютеры его сломают

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
Действительно ли GPT-5.6 Sol обошёл Fable 5 или просто выиграл более лёгкую корону? | Yellow