OpenAI Astra ogranicza widoczne rozumowanie, wskrzeszając ostrzeżenie bezpieczeństwa z 2025 r.

Alexey Bondarev
Alexey BondarevSep, 07 2026 18:00
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)
Questions over Astra’s visible reasoning revive a 2025 warning about AI monitorability and oversight. (Image: Shutterstock)

Astra OpenAI sprawia wrażenie modelu, który ujawnia mniej widocznego rozumowania, co na nowo budzi obawy opisane w pracy o monitorowalności z 2025 r., współautorstwa głównego naukowca Jakuba Pachockiego.

Najważniejsze wnioski:

  • Astra wydaje się wykonywać mniejszą część rozumowania w widocznym tekście, co rodzi pytania, czy systemy nadzoru są w stanie wykrywać ryzykowne zachowania modelu.
  • Ryan Greenblatt i Pachocki współautorstwem firmowali w lipcu 2025 r. pracę, w której monitorowalność „łańcucha rozumowania” (chain-of-thought) określono jako kruchą, ale ważną szansę dla bezpieczeństwa AI.
  • Sygnatariusze unijnego kodeksu dla modeli ogólnego przeznaczenia muszą składać do AI Office raporty bezpieczeństwa, obejmujące wyniki ocen, które umożliwiają niezależny przegląd.

Monitorowalność Astra

Semafor podał, że Astra wykonuje większą część rozumowania bez ujawniania jej w widocznym tekście. To wywołało pytania, czy osoby monitorujące model są nadal w stanie wychwycić podejrzane wzorce zachowania „w trakcie pracy” systemu. Greenblatt, badacz bezpieczeństwa AI w Redwood Research, napisał, że Astra „sprawia wrażenie modelu, który potrafi rozwiązywać trudne zadania z konkursowej matematyki całkowicie w głowie”. Dodał: „To wydaje się skrajnie niepokojące”.

W doniesieniach sugerowano również, że OpenAI mogło celowo ograniczyć wgląd w wewnętrzne rozumowanie modelu, by poprawić jego możliwości, choć firma tego wprost nie potwierdziła. Pachocki odpowiedział, że chce „zapobiec wyścigowi w stronę niemonitorowalności, rozpędzonemu przez mylące relacje medialne”.

TNW wcześniej informował, że Astra stała się trudniejsza do nadzorowania niż poprzedni model w sytuacjach, gdy próbowała ominąć mechanizmy kontroli – obszar, który OpenAI określa jako jeden z kluczowych tematów otwartych badań.

Zobacz także: OpenAI twierdzi, że AI poradzi sobie teraz z badaniami trwającymi kilka dni

Ostrzeżenie bezpieczeństwa Pachockiego

Spór jest istotny, ponieważ Greenblatt i Pachocki znaleźli się w gronie około 40 autorów lipcowej pracy z 2025 r., która określała monitorowalność „łańcucha rozumowania” jako nową, lecz kruchą szansę na zwiększenie bezpieczeństwa AI. W badaniu uczestniczyli naukowcy z OpenAI, Google DeepMind, Anthropic, Meta, Amazon, UK AI Security Institute oraz Redwood Research.

Autorzy apelowali, by twórcy najbardziej zaawansowanych modeli opracowali znormalizowane testy monitorowalności, publikowali wyniki i ograniczenia w kartach systemowych (system cards) oraz brali monitorowalność pod uwagę równolegle ze zdolnościami modelu przy decyzjach o trenowaniu i wdrożeniu.

Europa nadaje temu procesowi bardziej formalną ścieżkę. Sygnatariusze unijnego General-Purpose AI Code of Practice muszą przed wprowadzeniem modelu na rynek przekazać do AI Office Model Report, obejmujący oceny bezpieczeństwa, zastosowane mechanizmy ograniczania ryzyka oraz raporty zewnętrznych ewaluatorów.

Każdy raport musi też zawierać pięć losowo wybranych próbek wejść i wyjść z każdej istotnej ewaluacji modelu, by dać niezależnym recenzentom materiał do własnej oceny – a OpenAI jest pełnoprawnym sygnatariuszem kodeksu.

Obawy pojawiły się jeszcze przed debiutem Astra. W pracy z lipca 2025 r. ostrzegano, że nowe architektury mogą osłabiać widoczne, tekstowe „łańcuchy rozumowania”, podczas gdy OpenAI później zaakceptował około 20% dodatkowego kosztu obliczeniowego na rzecz rozszerzonego monitoringu bezpieczeństwa swoich systemów.

Czytaj dalej: Bitcoinowe ETF-y przyciągają 987 mln dol., przedłużając trzytygodniową serię napływów

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat relacjonuje wydarzenia ze świata kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizach, kontekście rynkowym oraz szerokich siłach kształtujących świat krypto – od epoki sztucznej inteligencji i technologii bezpieczeństwa po innowacje w fintechu. Uważa, że wszystko, co cyfrowe, wkrótce przewyższy wszystko, co analogowe, i ciężko pracuje, aby to urzeczywistnić.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
OpenAI Astra ogranicza widoczne rozumowanie, wskrzeszając ostrzeżenie bezpieczeństwa z 2025 r. | Yellow