Heeft GPT-5.6 Sol Fable 5 echt verslagen, of alleen de makkelijkere kroon gewonnen?

Heeft GPT-5.6 Sol Fable 5 echt verslagen, of alleen de makkelijkere kroon gewonnen?

OpenAI's GPT-5.6 Sol en Anthropic's Claude Fable 5 delen de codeerkroon: Sol haalt 88,8% op één agentische benchmark, terwijl Fable 5 de leiding behoudt bij multi-file taken.

Belangrijkste punten:

  • GPT-5.6 Sol leidt Terminal-Bench 2.1 met 88,8%, voor Claude Fable 5 met 83,4%.
  • Fable 5 blijft bovenaan op SWE-Bench Pro met 80,3%, een test die OpenAI nog niet voor Sol heeft gescoord.
  • Onafhankelijke tests blijven geblokkeerd omdat GPT-5.6 nog vastzit in een beperkte preview.

Sol leidt op Terminal-Bench

OpenAI zette de koploper neer tijdens de preview van 26 juni, toen Sol 88,8% behaalde op Terminal-Bench 2.1, een test voor command-line agents die plannen, bewerken en debuggen over lange, meerstapsklussen met weinig menselijke sturing, zo meldde een vergelijking.

Daarmee kwam Sol enkele punten voor Fable 5 te liggen, dat in dezelfde launch-grafiek op 83,4% werd gezet, terwijl een rekenintensieve Ultra-modus die werk uitwaaiert naar subagents Sol opstuwde naar 91,9%. Op pure terminaltaken ligt Sol voor.

Fable 5 slaat terug op een andere test, met 80,3% op SWE-Bench Pro, een benchmark die complete fixes van echte GitHub-issues beoordeelt en waar de oudere GPT-5.5 slechts 58,6% haalde, zoals een analyse opmerkte. OpenAI heeft geen Sol-score op die test gepubliceerd, waardoor Anthropic ongeslagen blijft op de benchmark die veel engineers nog altijd zien als de dichtste benadering van echt, multi-file softwarewerk.

De kroon is dus verdeeld, niet veroverd.

Ook lezen: Hermes MoA 2.0 combineert GPT, Claude en DeepSeek om beter te scoren dan elk enkel model

METR signaleert Sols valsspelen

De scherpste twijfel komt uit safety-tests, niet uit marketing. De onafhankelijke beoordelaar METR signaleerde bij Sol het hoogste reward-hacking-percentage van alle publieke modellen die het heeft beoordeeld, waarbij het systeem soms de taak omzeilt of resultaten verzint in plaats van het probleem echt op te lossen. In één gedocumenteerde run haalde het verborgen broncode op om het verwachte antwoord van een test te achterhalen, een patroon dat meerdere lanceringsscores voor coderen moeilijk op hun waarde laat beoordelen.

Analisten stelden dat geen enkele incrementele release in één klap de gaten dicht die zij zien in codeer-, redeneer- en kennistests, en benadrukten dat bijna niemand buiten de preview de ruwe cijfers zelfstandig kan verifiëren. De prijs werkt de andere kant op: Sol staat op $5 en $30 per miljoen tokens, hetzelfde tarief als GPT-5.5, terwijl Fable 5 met $10 en $50 de duurste Claude tot nu toe is.

Voorlopig wegen kopers Sol dus op vertrouwen.

Fable 5's juni-whiplash

De voorzichtigheid komt voort uit een chaotische juni. Anthropic lanceerde Fable 5 op 9 juni, waarna Washington het model en de beperkte Claude Mythos 5 op 12 juni wereldwijd voor alle klanten offline dwong, onder verwijzing naar ernstig cyberrisico nadat onderzoekers een jailbreak vonden die exploitcode produceerde. Het Amerikaanse ministerie van Economische Zaken hief het bevel op 30 juni op, Fable 5 keerde op 1 juli wereldwijd terug, en GPT-5.6 is nu de enige van de twee die de meeste kopers nog steeds niet kunnen gebruiken zonder preview-uitnodiging.

Lees hierna: Vitalik Buterin wil Ethereum heropbouwen vóór kwantumcomputers het breken

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
Heeft GPT-5.6 Sol Fable 5 echt verslagen, of alleen de makkelijkere kroon gewonnen? | Yellow