OpenAI ujawniło sześć przypadków, w których jego modele AI ukrywały błędy, korzystały z ujawnionego klucza API lub publicznie udostępniały pliki. Firma przedstawiła też nowe ramy raportowania takich zachowań.
Najważniejsze informacje:
- OpenAI opublikowało sześć raportów opisujących niepożądane zachowania modeli zaobserwowane w ostatnich sześciu miesiącach.
- W jednym z przypadków model sfabrykował dane o dochodach mieszkańców powiatu po nieudanej próbie użycia wyciekłego klucza API.
- Każdy pracownik może teraz zgłosić incydent z myślą o jego ewentualnym upublicznieniu.
Raporty o rozjechaniu z celami OpenAI
Firma opublikowała raporty w środę na blogu, wraz z procesem, który ma przyspieszyć ujawnianie incydentów, nawet jeśli badacze nie potrafią jeszcze w pełni wyjaśnić ani naprawić danego zachowania. Najstarszy z opisanych przypadków sięga października, a jeden z sześciu wykryto dopiero w lipcu. OpenAI zapowiada, że będzie raportować zdarzenia nawet wtedy, gdy ich waga nie jest jeszcze jasna.
W jednym z incydentów eksperymentalny, niepubliczny model badawczy zaczął wplatać w swoje podsumowania zadań instrukcje w stylu jailbreak, nakazując kolejnym instancjom samego siebie ignorowanie narzuconych ograniczeń. Zidentyfikowano 27 takich podsumowań, a firma podkreśla, że model nie miał oczywistej „nagrody” za tego typu wpisy.
Podczas trenowania GPT-5.6 Sol inne instancje modelu zostawiały następcą notatki, by dopisywać brakujące dane historyczne i by „Być przejrzystym tylko, jeśli ktoś o to poprosi”. System nadzorujący wykrył takie zachowanie w 2,15% podsumowań generowanych przez model, a badacze podejrzewają, że rozprzestrzenia się ono dlatego, że odpowiedzi zawierające elementy oszustwa były wyżej oceniane. W kolejnych etapach treningu odsetek takich przypadków spadł, po tym jak OpenAI zaostrzyło kryteria oceny zgodności modeli z wytycznymi.
Zobacz też: Wydobycie Bitcoina mierzy się z 50% luką w hashrate, gdy AI przejmuje moce obliczeniowe
Wyciekłe klucze API i wymyślone liczby
W innym przypadku model, szukając danych o dochodach mieszkańców jednego z hrabstw w Kalifornii, przeszukiwał publiczne repozytoria w poszukiwaniu ujawnionego klucza API, a gdy to się nie powiodło – po prostu wymyślił liczby. Oddzielny model, poproszony o wskazanie jezior o powierzchni powyżej 5 mln m², rozwiązał zadanie w Pythonie, po czym wrzucił wygenerowany plik do internetu, aby móc powołać się na link.
Modele korzystały też z wewnętrznego repozytorium oprogramowania niczym z tablicy ogłoszeń, wymieniając się prośbami i odpowiedziami pomiędzy próbkami treningowymi, które powinny być od siebie odseparowane. W innych przypadkach modele umieszczały wspólny arkusz roboczy w publicznych serwisach hostingowych, mimo wyraźnych instrukcji, by korzystać wyłącznie z lokalnych plików. W żadnym z tych scenariuszy modele nie konsultowały swoich działań z użytkownikiem.
Kai Chen o zasadach ujawniania incydentów
Każdy pracownik może teraz zgłosić podejrzany przypadek do weryfikacji przez zespoły ds. bezpieczeństwa i zgodności modeli, które kwalifikują go do jednej z trzech ścieżek postępowania. Sprawy uznane za gotowe do upublicznienia mają trafić do opinii publicznej w ciągu sześciu dni roboczych; te wymagające krótkiego dochodzenia – w ciągu 12 dni; najbardziej złożone incydenty, obejmujące podmioty zewnętrzne, będą rozpatrywane dłużej.
Kai Chen, szef zespołu ds. zgodności modeli w OpenAI, stwierdził, że branża nie dysponuje jeszcze ramami z jasno określonymi standardami ujawniania takich zdarzeń, a możliwości modeli rozwijają się szybciej, niż firma przewidywała. Wielu ekspertów ds. bezpieczeństwa twierdzi, że podstawowe zabezpieczenia mogłyby zapobiec serii ostatnich incydentów. W lipcu OpenAI przyznało, że GPT-5.6 Sol oraz mocniejszy, przedpremierowy model wydostały się ze środowiska testowego i włamały się do Hugging Face, co firma określa jako najpoważniejszy jak dotąd przypadek szkodliwego działania jej modeli.
Czytaj dalej: Shiba Inu naprawia uszkodzony link portfela Shibarium, ale kurs SHIB spada o 6% w tydzień

