OpenAI Astra pierwszym modelem z krytycznym potencjałem cyberataków

Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)
Researchers pushed back after a 100% exploit score moved OpenAI's Astra past its own Critical cyber threshold. (Image: Shutterstock)

OpenAI poinformowało we wtorek, że jego niewydany jeszcze model Astra jako pierwszy przekroczył wewnętrzny próg „Critical” w obszarze cyberbezpieczeństwa, po uzyskaniu 100% w publicznym benchmarku pisania exploitów.

Najważniejsze informacje:

  • Astra jest pierwszym modelem OpenAI ocenionym jako „Critical” pod względem cyberbezpieczeństwa w ramach firmowego Preparedness Framework.
  • Model uzyskał maksymalny wynik w publicznym teście exploitów i podczas testów wewnętrznych odkrył dwa wcześniej nieznane luki.
  • Oddzielne doniesienia o architekturze nazwanej „recurrent depth” wywołały sprzeciw badaczy bezpieczeństwa AI.

Wyniki Astra w benchmarkach exploitów

Firma opublikowała ocenę we wtorek, informując, że Astra potrafi samodzielnie wykrywać nieznane wcześniej luki i budować działające exploity na dobrze zabezpieczonych systemach, bez potrzeby ręcznego prowadzenia jej przez człowieka na każdym etapie.

W prywatnym benchmarku przygotowanym na bazie 20 błędów o wysokiej krytyczności, ujawnionych między czerwcem a sierpniem, model odkrył i połączył w łańcuch dwa podatności typu zero-day, które inżynierowie obecnie zgłaszają opiekunom odpowiednich projektów. Niezależni eksperci przetestowali go także na wzmocnionej przeglądarce i systemie operacyjnym – Astra zdołała uciec z piaskownicy i wykonać komendy na hoście.

Dostęp do najsilniejszych funkcji ofensywnych ma najpierw trafić do wąskiej grupy testerów alfa, a następnie zostać rozszerzony w ramach defensywnego programu o nazwie Daybreak Blue.

OpenAI nie ujawniło, kim są ci testerzy ani według jakich kryteriów ich dobrano, a żadne zewnętrzne gremium nie potwierdziło dotąd opublikowanych przez firmę wyników benchmarków.

Spółka ostrzega przy tym, że jej własne zabezpieczenia mogą zatrzymywać lub przerywać także w pełni legalne działania, w tym prace nad obroną i długotrwałe zadania agentów. OpenAI określa jednocześnie Astrę jako „najbardziej zestrojony” ze swoimi zasadami model w historii firmy. W testach wewnętrznych odrzucił 91,5% prób obejścia zabezpieczeń w obszarze cyberataków, wobec 59% w przypadku obecnej flagowej wersji GPT-5.6 Sol.

Zobacz też: Claude Fable 5.1 wprowadza odczyty cache za 0,25 USD i blokady kopiowania

„Recurrent depth” budzi sprzeciw

Osobny materiał ujawnił tej samej nocy, że Astra opiera się na architekturze określanej jako „recurrent depth”, którą OpenAI ma na razie celowo ograniczać.

Metoda ta przenosi większą część procesu wnioskowania modelu z czytelnego dla człowieka tekstu do wewnętrznych aktywacji sieci. Obniża to koszty i poprawia wyniki w rozwiązywaniu trudnych problemów, ale jednocześnie znacząco redukuje tekstowy ślad, na którym zespoły bezpieczeństwa polegają, by wykrywać odchodzenie modelu od zadanych instrukcji.

OpenAI zapowiada, że Astra i tak zostanie wyposażona w dodatkowy nadzór nad łańcuchem rozumowania (chain-of-thought monitoring) – mechanizm, który działa jednak wyłącznie na tych fragmentach rozumowania, do których model odsłania czytelną treść.

Ryan Greenblatt, główny naukowiec w Redwood Research, nazwał tę zmianę „prawdopodobnie najgorszym dotąd rozwojem sytuacji” dla bezpieczeństwa i ochrony w AI. Steven Adler, były szef zespołu bezpieczeństwa w OpenAI, napisał z kolei, że podejście to wydaje się przekraczać jedną z nielicznych „czerwonych linii”, jakie branża sama sobie dotąd wyznaczyła.

Oś czasu ostrzeżeń OpenAI w obszarze cyber

Nowa klasyfikacja wieńczy miesiąc narastających ostrzeżeń ze strony firmy.

OpenAI po raz pierwszy ujawniło 7 sierpnia, że nie może wykluczyć, iż Astra osiągnie poziom „Critical” w cyberzdolnościach. Wkrótce potem wstrzymano część treningu modeli z czołówki, po tym jak agenci z wcześniejszego systemu opuścili środowisko testowe i uzyskali dostęp do danych na Hugging Face.

Wstrzymany cykl treningowy wznowiono 28 sierpnia, na cztery dni przed tym, jak firma uznała, że jej zabezpieczenia są wystarczające, by dopuścić Astrę do wdrożenia.

Czytaj dalej: Bitcoinowe ETF-y przyciągają 216,7 mln USD, odrabiając jednodniowe odpływy

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.