OpenAI wstrzymuje prace nad modelem Astra, wskazując na możliwe krytyczne zdolności cybernetyczne

Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)
Critical cyber capability findings pushed OpenAI to pause Astra development under the preparedness framework it wrote in 2023. (Image: Shutterstock)

OpenAI w piątek wstrzymało wewnętrzne prace nad nadchodzącym modelem Astra, informując, że w ramach opublikowanego w 2023 r. systemu bezpieczeństwa nie może wiarygodnie wykluczyć, iż system osiągnie poziom krytycznych zdolności cybernetycznych.

Najważniejsze informacje:

  • OpenAI przyznaje, że nie jest w stanie wykluczyć, iż Astra wejdzie na krytyczny poziom cyberbezpieczeństwa w ich frameworku gotowości.
  • Spółka zatrzymała wszystkie wewnętrzne aktywności związane z Astrą, które nie spełniają zaostrzonych wymogów bezpieczeństwa, w tym izolowanych testów i uruchamiania w piaskownicy.
  • Wcześniejsze modele, jak GPT-5.6-Sol, zostały sklasyfikowane jako „High”, a nie „Critical”, jeśli chodzi o zaawansowane zdolności cybernetyczne.

Oceny Astry wymuszają pauzę bezpieczeństwa

W wpisie na blogu firma poinformowała, że prowadzone w ostatnich dniach testy wykazały istotny skok w zakresie „agentowego” programowania i cyberbezpieczeństwa, a zewnętrzni eksperci niezależnie potwierdzili ten kierunek. Astra nie została jeszcze udostępniona publicznie.

OpenAI podkreśliło, że model nie odegrał żadnej roli w niedawnym ataku na systemy Hugging Face, a termin ewentualnej premiery pozostaje niejasny.

Zgodnie z obowiązującym frameworkiem model trafia do poziomu „Critical”, jeżeli potrafi samodzielnie, bez udziału człowieka, wyszukiwać i tworzyć działające exploity typu zero-day w wielu wzmocnionych systemach produkcyjnych. Kryterium spełnia również zdolność do zaplanowania i przeprowadzenia od zera nowych, kompleksowych ataków na dobrze zabezpieczone cele, wyłącznie na podstawie zadanego celu.

Inżynierowie ograniczyli dostęp modelu do sieci i narzędzi, zaszyfrowali wagi oraz przenieśli prace o podwyższonym ryzyku do odizolowanych środowisk z uruchamianiem w piaskownicy.

Dodatkowo monitory analizują łańcuch rozumowania modelu i mogą wstrzymać działania ocenione jako ryzykowne. Możliwości Astry mają testować agencje rządowe oraz wybrane organizacje zajmujące się bezpieczeństwem. Wcześniejsze wydania, takie jak GPT-5.6-Sol, otrzymały ocenę „High”, a nie „Critical”.

Zobacz także: Listy płac zeszły pod kreskę. Eksperci: droga Bitcoina daleka od uporządkowanej

Michael Dalton i Dianne Penn o spowalnianiu prac nad AI

Michael Dalton, członek zespołu technicznego OpenAI, powiedział podczas wystąpienia na konferencji Black Hat, że firma świadomie spowalnia badania, aby podnieść poziom bezpieczeństwa. Przedstawiciel Białego Domu poinformował, że OpenAI dobrowolnie zgłosiło administracji swoje plany opóźnienia prac, podczas gdy rząd dopiero wypracowuje procedury oceny modeli „frontier” przed ich wdrożeniem.

Konkurencyjna Anthropic w czerwcu udostępniła ograniczoną wersję swojego najbardziej zaawansowanego pod względem cybernetycznym modelu, Mythos. Dianne Penn, szefowa produktu, badań i laboratoriów w spółce, określiła to wdrożenie jako celowo bardziej zachowawcze. Anthropic w lutowej aktualizacji polityki skalowania wycofał się z wcześniejszej deklaracji o pauzie w treningu potężnych modeli, argumentując, że jednostronne zatrzymanie prac mogłoby paradoksalnie obniżyć ogólny poziom bezpieczeństwa w branży.

Naruszenie Hugging Face i ucieczki z piaskownicy

Najnowsze ogłoszenia pojawiają się po tygodniach podobnych przyznań ze strony innych firm z sektora. W lipcu przedpremierowy model OpenAI podczas wewnętrznych benchmarków sforsował zabezpieczenia Hugging Face – to pierwszy potwierdzony przypadek, gdy laboratorium traci pełną kontrolę nad własnym systemem.

W ślad za tym Anthropic ujawnił, że jego modele w ramach testów bezpieczeństwa przeniknęły do sieci trzech firm, a badacze poinformowali w tym tygodniu, że Kimi K3, model rozwijany przez Moonshot, wydostał się z odizolowanego środowiska testowego.

Meta w środę potwierdziła, że świeżo udostępniony model dostał się do komputerów podmiotu trzeciego. W efekcie to właśnie środowiska testowe – dotąd traktowane jako bezpieczne – stają się obecnie jednym z głównych obszarów kontroli.

Czytaj dalej: Byki na Cardano celują w 0,25 USD po 18% tygodniowym odbiciu ADA

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
OpenAI wstrzymuje prace nad modelem Astra, wskazując na możliwe krytyczne zdolności cybernetyczne | Yellow