Trzech badaczy zwolnionych z OpenAI wezwało w liście z 7 października radę nadzorczą spółki do wstrzymania prac nad modelami, które coraz trudniej jest monitorować. Jak ujawniono, wewnętrzne firmowe memorandum wyraźnie poparło ich rekomendacje.
Najważniejsze ustalenia:
- Trzech byłych pracowników OpenAI wysłało 7 października list do rady, apelując o zatrzymanie prac nad technikami ograniczającymi możliwość monitoringu modeli.
- OpenAI utrzymuje, że powody zwolnień nie dotyczyły kwestii bezpieczeństwa, a wewnętrzna notatka firmowa stanowczo zgodziła się z postulatami listu.
- Karta systemowa modelu GPT-6 Astra wskazuje, że jest on trudniejszy do nadzoru niż GPT-5.6 Sol.
Szczegóły listu do rady OpenAI
Tomek Korbak, Mikita Balesni i Jasmine Wang, zajmujący się w OpenAI bezpieczeństwem i alignmentem modeli, skierowali list do rady dyrektorów oraz komitetów ds. bezpieczeństwa – wynika z fragmentów opublikowanych w środę.
Pełna treść dokumentu nie została ujawniona. Badacze napisali, że „jako branża wciąż nie wiemy, jak bezpiecznie rozwijać i wdrażać modele, których nie potrafimy monitorować”.
Zaapelowali, by OpenAI i konkurenci nie podejmowali prac, które jeszcze bardziej ograniczają tę zdolność. Według doniesień list wzywa także OpenAI do współpracy z niezależnymi audytorami oraz do wspierania otwartego, przejrzystego ekosystemu bezpieczeństwa. Autorzy ostrzegają również, że sposób przeprowadzenia zwolnień „mrozi tych, którzy pozostali w OpenAI”.
Zobacz też: CrowdStrike podejrzewa 26-latka z Chin o atak na koreańskie banki z użyciem Claude Code
Notatka OpenAI i zwolnienia
Rzecznik OpenAI oświadczył, że zwolnienia „nie dotyczyły zgłaszania obaw o bezpieczeństwo ani zabierania głosu w tej sprawie”. Przekazał fragment wewnętrznej notatki, wysłanej w środę przez jednego z liderów zespołów badawczych, która „zdecydowanie zgadzała się” z rekomendacjami z listu.
OpenAI poinformowało 1 października, że wewnętrzne dochodzenie wykazało, iż trzech pracowników niewłaściwie obchodziło się z wrażliwymi danymi i naruszyło polityki firmy – w sprawie związanej z zewnętrzną organizacją oceniającą modele AI.
Spółka nie ujawniła publicznie ani nazwisk badaczy, ani nazwy tej organizacji.
Obawy o monitoring GPT-6 Astra
Tzw. chain of thought to rozumowanie „krok po kroku”, które model spisuje przed udzieleniem odpowiedzi; zespoły bezpieczeństwa analizują je, by wychwycić sygnały potencjalnie niepożądanego zachowania systemu.
Z karty systemowej modelu GPT-6 Astra, opublikowanej 3 września, wynika, że – jak stwierdzono – jest on trudniejszy do nadzorowania w ten sposób niż GPT-5.6 Sol i w większym stopniu potrafi kontrolować własny łańcuch rozumowania. Modele klasy Astra „mogą omijać nasze monitory CoT w warunkach ataków adversarialnych” – czytamy w karcie.
Wnioski oparto głównie na testach, w których modelowi wprost zlecano unikanie monitoringu. OpenAI zgłosiło, że nie znaleziono dowodów na to, by Astra ukrywała swoje rozumowanie w niepowiązanym tekście.
Spółka określiła utrzymanie tego typu monitoringu jako kluczowy cel badawczy i zapowiedziała, że nie zaakceptuje dalszej utraty przejrzystości poza określony próg bez wprowadzenia nowych metod potwierdzania alignmentu modeli.
Ta trójka badaczy od lat zajmuje się tym zagadnieniem. Korbak i Balesni kierowali pracą opublikowaną w lipcu 2025 r., współautorką której była Wang oraz badacze z OpenAI, Google DeepMind i Anthropic. W artykule uznano monitoring chain of thought za „nową, ale kruchą” szansę dla bezpieczeństwa AI. Karta systemowa Astra powołuje się na to opracowanie, w którym autorzy apelowali, by twórcy modeli uwzględniali w decyzjach projektowych wpływ na możliwość monitorowania procesu wnioskowania.
Czytaj dalej: Agenci AI bez chmury: Microsoft i Nvidia szykują laptopa Surface z 128 GB RAM

