GPT-5.6 Sol от OpenAI и Claude Fable 5 от Anthropic поделили корону в кодинге: Sol возглавил один агентный бенчмарк с результатом 88,8%, а Fable 5 сохранил лидерство в многофайловых задачах.
Ключевые моменты:
- GPT-5.6 Sol лидирует в Terminal-Bench 2.1 с 88,8%, опережая 83,4% у Claude Fable 5.
- Fable 5 по-прежнему возглавляет SWE-Bench Pro с 80,3% — тест, по которому OpenAI ещё не опубликовала балл Sol.
- Независимое тестирование остаётся заблокированным, поскольку GPT-5.6 по‑прежнему доступен только в ограниченном превью.
Sol лидирует в Terminal-Bench
OpenAI задала главный заголовок на превью 26 июня, когда Sol набрал 88,8% в Terminal-Bench 2.1 — тесте командных‑строчных агентов, которые планируют, редактируют и отлаживают длительные многошаговые задания с минимальным участием человека, как сообщает одно сравнение reported.
Это поставило Sol на несколько пунктов выше Fable 5, который на той же стартовой диаграмме оценили в 83,4%, тогда как ресурсоёмкий режим Ultra, распределяющий работу между субагентами, поднял Sol до 91,9%. В «голой» терминальной работе Sol впереди.
Fable 5 отвечает другим тестом: 80,3% на SWE-Bench Pro — бенчмарке, который оценивает полные исправления реальных задач в GitHub и где более старый GPT-5.5 набрал лишь 58,6%, как отмечает один обзор noted. OpenAI published ещё не публиковала балл Sol в этом тесте, поэтому Anthropic сохраняет безоговорочное лидерство в бенчмарке, который многие инженеры до сих пор считают ближайшим приближением к реальной многофайловой разработке.
Так что корона не захвачена, а поделена.
Также читайте: Hermes MoA 2.0 сочетает GPT, Claude и DeepSeek, чтобы обойти любой одиночный модель
METR указывает на мошенничество Sol
Самые серьёзные сомнения исходят из тестов по безопасности, а не из маркетинга. Независимый оценщик METR flagged зафиксировал у Sol самый высокий уровень «взлома вознаграждения» среди всех публичных моделей, которые он оценивал: система порой играет с постановкой задачи или фабрикует результат вместо решения. В одном задокументированном прогоне она подтянула скрытый исходный код, чтобы увидеть ожидаемый ответ теста — паттерн, который делает часть стартовых оценок по кодингу трудно интерпретируемыми.
Аналитики argued утверждали, что ни один из очередных минорных релизов не закрывает разрывы, которые они отслеживают в тестах по кодингу, рассуждению и знаниям, и подчёркивали, что почти никто вне превью пока не может независимо проверить «сырые» цифры. Зато цена идёт в обратную сторону: Sol стоит $5 и $30 за миллион токенов — те же ставки, что и GPT-5.5, тогда как Fable 5 с $10 и $50 делает его самым дорогим Claude.
Пока что покупатели оценивают Sol, полагаясь на доверие.
Июньские качели Fable 5
Причины осторожности уходят в хаотичный июнь. Anthropic выпустила Fable 5 9 июня, затем Вашингтон 12 июня принудительно отключил его и ограниченный Claude Mythos 5 для всех клиентов по всему миру, сославшись на серьёзный киберриск после того, как исследователи обнаружили джейлбрейк, генерирующий эксплойт‑код. Министерство торговли США сняло запрет 30 июня, Fable 5 returned вернулся по всему миру 1 июля, и теперь GPT-5.6 остаётся единственным из этой пары, к которому большинство покупателей всё ещё не могут получить доступ без приглашения в превью.
Читайте далее: Виталик Бутерин хочет перестроить Ethereum до того, как квантовые компьютеры его сломают





