OpenAI Astra ukrywa więcej rozumowania, wskrzeszając ostrzeżenia o bezpieczeństwie z 2025 r.

Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

OpenAI’s Astra wydaje się ujawniać znacznie mniej swojego procesu rozumowania, co przywraca obawy opisane w pracy o monitorowalności z 2025 r., współautorstwa głównego naukowca Jakuba Pachockiego.

Najważniejsze wnioski:

  • Astra zdaje się wykonywać mniejszą część rozumowania w widocznym tekście, co rodzi pytania, czy systemy nadzoru wciąż potrafią wykryć problematyczne zachowania.
  • Ryan Greenblatt i Pachocki współtworzyli w lipcu 2025 r. publikację, w której monitorowalność łańcucha rozumowania określono jako kruchą, ale kluczową szansę dla bezpieczeństwa AI.
  • Sygnatariusze unijnego kodeksu dla systemów ogólnego przeznaczenia muszą składać do AI Office raporty bezpieczeństwa modeli, z wynikami ewaluacji umożliwiającymi niezależny audyt.

Monitorowalność Astra

Semafor informował, że Astra wykonuje więcej rozumowania „pod maską”, bez ujawniania go w jawnym tekście. To wywołało pytania, czy zespoły monitorujące są w stanie nadal wychwycić podejrzane zachowania modelu w trakcie jego pracy. Greenblatt, badacz bezpieczeństwa AI w Redwood Research, napisał, że Astra „wygląda, jakby potrafiła rozwiązywać trudne zadania z matematyki konkursowej całkowicie w głowie”. Dodał: „To wydaje się skrajnie niepokojące”.

W doniesieniach sugerowano również, że OpenAI mogło celowo ograniczyć widoczność procesu generowania odpowiedzi, by poprawić możliwości modelu, choć firma tego nie potwierdziła. Pachocki odpowiedział, że chce „zapobiec wyścigowi w kierunku niemierzalnej nieprzezroczystości, napędzanemu błędnymi relacjami”.

TNW wcześniej wskazywało, że Astra stała się trudniejsza do monitorowania niż jej poprzednik, gdy model próbował omijać nadzór – obszar, który OpenAI określa jako jedno z głównych, wciąż otwartych zagadnień badawczych.

Zobacz też: OpenAI Says AI Can Now Handle Research Tasks Lasting Several Days

Ostrzeżenie Pachockiego dotyczące bezpieczeństwa

Spór jest istotny, ponieważ Greenblatt i Pachocki należeli do ok. 40 autorów lipcowej pracy z 2025 r., w której monitorowalność łańcucha rozumowania opisano jako nowe, lecz kruche okno możliwości dla bezpieczeństwa sztucznej inteligencji. W projekcie uczestniczyli badacze z OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute oraz Redwood Research.

Autorzy apelowali, by twórcy najbardziej zaawansowanych modeli opracowali wystandaryzowane ewaluacje monitorowalności, publikowali wyniki i ograniczenia w kartach systemowych oraz uwzględniali monitorowalność na równi z możliwościami modelu przy decyzjach o treningu i wdrożeniu.

Europa nadaje temu procesowi formalne ramy. Sygnatariusze unijnego General-Purpose AI Code of Practice muszą przed wprowadzeniem modelu na rynek przekazać do AI Office Model Report – raport obejmujący ewaluacje, zastosowane środki ograniczania ryzyka oraz opinie zewnętrznych ewaluatorów.

Każdy raport musi także zawierać pięć losowo wybranych par wejść i wyjść z każdej istotnej ewaluacji modelu, co dostarcza niezależnym recenzentom materiału do samodzielnej analizy. OpenAI jest pełnoprawnym sygnatariuszem kodeksu.

Obawy te pojawiły się jeszcze przed premierą Astra. W lipcowej pracy z 2025 r. ostrzegano, że nowe architektury mogą osłabić widoczność łańcucha rozumowania, podczas gdy OpenAI zgodziło się później na około 20-procentowy narzut obliczeniowy w zamian za rozszerzony nadzór bezpieczeństwa swoich systemów.

Przeczytaj następnie: Bitcoin ETFs Pull In $987M, Extending Inflow Streak To Three Weeks

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
OpenAI Astra ukrywa więcej rozumowania, wskrzeszając ostrzeżenia o bezpieczeństwie z 2025 r. | Yellow