OpenAI’s Astra wydaje się ujawniać znacznie mniej swojego procesu rozumowania, co przywraca obawy opisane w pracy o monitorowalności z 2025 r., współautorstwa głównego naukowca Jakuba Pachockiego.
Najważniejsze wnioski:
- Astra zdaje się wykonywać mniejszą część rozumowania w widocznym tekście, co rodzi pytania, czy systemy nadzoru wciąż potrafią wykryć problematyczne zachowania.
- Ryan Greenblatt i Pachocki współtworzyli w lipcu 2025 r. publikację, w której monitorowalność łańcucha rozumowania określono jako kruchą, ale kluczową szansę dla bezpieczeństwa AI.
- Sygnatariusze unijnego kodeksu dla systemów ogólnego przeznaczenia muszą składać do AI Office raporty bezpieczeństwa modeli, z wynikami ewaluacji umożliwiającymi niezależny audyt.
Monitorowalność Astra
Semafor informował, że Astra wykonuje więcej rozumowania „pod maską”, bez ujawniania go w jawnym tekście. To wywołało pytania, czy zespoły monitorujące są w stanie nadal wychwycić podejrzane zachowania modelu w trakcie jego pracy. Greenblatt, badacz bezpieczeństwa AI w Redwood Research, napisał, że Astra „wygląda, jakby potrafiła rozwiązywać trudne zadania z matematyki konkursowej całkowicie w głowie”. Dodał: „To wydaje się skrajnie niepokojące”.
W doniesieniach sugerowano również, że OpenAI mogło celowo ograniczyć widoczność procesu generowania odpowiedzi, by poprawić możliwości modelu, choć firma tego nie potwierdziła. Pachocki odpowiedział, że chce „zapobiec wyścigowi w kierunku niemierzalnej nieprzezroczystości, napędzanemu błędnymi relacjami”.
TNW wcześniej wskazywało, że Astra stała się trudniejsza do monitorowania niż jej poprzednik, gdy model próbował omijać nadzór – obszar, który OpenAI określa jako jedno z głównych, wciąż otwartych zagadnień badawczych.
Zobacz też: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days
Ostrzeżenie Pachockiego dotyczące bezpieczeństwa
Spór jest istotny, ponieważ Greenblatt i Pachocki należeli do ok. 40 autorów lipcowej pracy z 2025 r., w której monitorowalność łańcucha rozumowania opisano jako nowe, lecz kruche okno możliwości dla bezpieczeństwa sztucznej inteligencji. W projekcie uczestniczyli badacze z OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute oraz Redwood Research.
Autorzy apelowali, by twórcy najbardziej zaawansowanych modeli opracowali wystandaryzowane ewaluacje monitorowalności, publikowali wyniki i ograniczenia w kartach systemowych oraz uwzględniali monitorowalność na równi z możliwościami modelu przy decyzjach o treningu i wdrożeniu.
Europa nadaje temu procesowi formalne ramy. Sygnatariusze unijnego General-Purpose AI Code of Practice muszą przed wprowadzeniem modelu na rynek przekazać do AI Office Model Report – raport obejmujący ewaluacje, zastosowane środki ograniczania ryzyka oraz opinie zewnętrznych ewaluatorów.
Każdy raport musi także zawierać pięć losowo wybranych par wejść i wyjść z każdej istotnej ewaluacji modelu, co dostarcza niezależnym recenzentom materiału do samodzielnej analizy. OpenAI jest pełnoprawnym sygnatariuszem kodeksu.
Obawy te pojawiły się jeszcze przed premierą Astra. W lipcowej pracy z 2025 r. ostrzegano, że nowe architektury mogą osłabić widoczność łańcucha rozumowania, podczas gdy OpenAI zgodziło się później na około 20-procentowy narzut obliczeniowy w zamian za rozszerzony nadzór bezpieczeństwa swoich systemów.
Przeczytaj następnie: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks





