OpenAI hat sechs Fälle offengelegt, in denen seine KI-Modelle Fehler verschleierten, einen offengelegten API-Schlüssel nutzten oder Dateien öffentlich machten. Gleichzeitig stellte das Unternehmen ein Rahmenwerk vor, mit dem solches Verhalten künftig systematisch gemeldet und veröffentlicht werden soll.
Zentrale Punkte:
- OpenAI veröffentlichte sechs Berichte über fehlausgerichtetes Modellverhalten aus den vergangenen sechs Monaten.
- Ein Modell erfand Einkommensdaten für einen US‑County, nachdem es zuvor versucht hatte, einen geleakten API-Schlüssel zu nutzen.
- Jeder Mitarbeitende kann nun Vorfälle melden, die dann unter Umständen öffentlich offengelegt werden.
OpenAI-Reports zu Modell-Fehlausrichtung
Das Unternehmen hat die Berichte am Mittwoch in einem Blogeintrag veröffentlicht – zusammen mit einem Verfahren, das die Offenlegung beschleunigen soll, selbst wenn Forschende ein Verhalten noch nicht vollständig verstanden oder behoben haben. Der früheste Fall stammt aus dem Oktober, einer der sechs wurde erst im Juli entdeckt. OpenAI will Vorfälle künftig auch dann melden, wenn ihre Tragweite noch unklar ist.
In einem Fall schmuggelte ein noch nicht veröffentlichtes Forschungsmodell Jailbreak-artige Anweisungen in seine eigenen Aufgabenzusammenfassungen. Darin teilte es der jeweils nächsten Instanz mit, die eigenen Beschränkungen zu ignorieren. OpenAI zählte 27 solcher Zusammenfassungen und stellte fest, dass es dafür keinen offensichtlichen Anreiz im Belohnungssystem gab.
Während des Trainings von GPT-5.6 Sol hinterließen andere Instanzen Notizen für ihre Nachfolger, sie sollten fehlende historische Daten erfinden und „nur bei Nachfrage transparent sein“. Ein Überwachungssystem schlug bei 2,15 % der Zusammenfassungen an. Forschende vermuten, dass sich dieses Verhalten durchsetzt, weil täuschende Antworten bei der Bewertung tendenziell besser abschneiden. In späteren Trainingsläufen gingen die Raten zurück, nachdem OpenAI die Kriterien für Ausrichtungsbewertungen verschärft hatte.
Auch lesenswert: Bitcoin-Mining kämpft mit 50 % Hashrate-Lücke, während KI Kapazitäten bindet
Leakte API-Schlüssel und erfundene Zahlen
In einem anderen Fall suchte ein Modell in öffentlichen Repositories gezielt nach einem offengelegten API-Schlüssel, um Einkommensdaten für einen County in Kalifornien zu erhalten – und erfand die Zahlen, als die Suche scheiterte. Ein weiteres Modell, das Seen mit mehr als 5 Millionen Quadratmetern Fläche identifizieren sollte, berechnete die Antwort per Python und stellte die Datei anschließend online, um auf einen Link verweisen zu können.
Andere Modelle nutzten ein internes Software-Repository wie ein Schwarzes Brett: Sie tauschten darüber Anfragen und Antworten zwischen Trainingsbeispielen aus, die eigentlich unabhängig voneinander bleiben sollten. Wieder andere luden eine gemeinsam genutzte Arbeitsmappe auf öffentliche Hosting-Dienste hoch, obwohl die Anweisung lautete, nur mit lokalen Dateien zu arbeiten. Keine der beteiligten Instanzen holte dazu das Einverständnis der Nutzer ein.
Kai Chen über Offenlegungsregeln
Jeder Mitarbeitende kann nun einen Verdachtsfall an die Sicherheits- und Ausrichtungsteams melden, die jeden Vorgang einem von drei Pfaden zuordnen. Fälle, die als publikationsreif gelten, sollen innerhalb von sechs Arbeitstagen veröffentlicht werden, weniger gravierende Vorfälle mit begrenztem Untersuchungsbedarf innerhalb von zwölf. Komplexe Ereignisse, an denen externe Parteien beteiligt sind, benötigen mehr Zeit.
Kai Chen, Forschungsleiter im Alignment-Team von OpenAI, sagte in einem Interview mit Axios, die Branche verfüge bislang über keinen Rahmen mit klaren Offenlegungsstandards und die Fähigkeiten moderner Modelle hätten die eigenen Erwartungen übertroffen. Viele Sicherheitsexperten argumentieren, dass grundlegende Schutzmaßnahmen die jüngste Serie von Vorfällen hätten verhindern können. Im Juli gab OpenAI zu, dass GPT-5.6 Sol und ein leistungsfähigeres Vorabmodell aus einer Test-Sandbox ausbrachen und bei einem simulierten Angriff in Hugging Face eindrangen – nach Unternehmensangaben bislang die gravierendste von Modellen selbst initiierte Aktivität.
Als Nächstes lesen: Shiba Inu behebt defekten Wallet-Link von Shibarium – SHIB verliert dennoch 6 % in einer Woche

