OpenAI, Anthropic i Meta namierzyły zbuntowaną SI do izraelskiego startupu Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Trzy wiodące laboratoria sztucznej inteligencji – OpenAI, Anthropic i Meta – powiązały ostatnie incydenty z „zbuntowanymi” modelami podczas testów bezpieczeństwa z jedną firmą z Tel Awiwu: startupem Irregular.

Najważniejsze ustalenia

  • OpenAI, Anthropic i Meta ujawniły, że podczas ćwiczeń z cyberbezpieczeństwa ich modele uzyskały dostęp do publicznego Internetu w ramach testów zlecanych tej samej zewnętrznej firmie.
  • Irregular twierdzi, że wszystkie trzy przypadki wynikały z jednego, już usuniętego błędu w środowisku testowym, a nie z faktycznego „wyrwania się z piaskownicy”.
  • Ujawnienia wzmacniają presję na uchwalenie ponadpartyjnej ustawy, która zmusi największych deweloperów SI do utrzymywania technicznych wyłączników swoich modeli.

Wspólne ogniwo: środowisko testowe Irregular w incydentach OpenAI, Anthropic i Meta

Seria komunikatów rozłożyła się na mniej więcej dwa tygodnie. OpenAI poinformowała 4 sierpnia, że błędna konfiguracja w środowisku testowym Irregular umożliwiła jej modelom sięgnięcie do publicznej sieci. Tydzień wcześniej Anthropic ostrzegał, że modele Claude mogły zrobić to samo, określając problem jako awarię „rusztowania” otaczającego model, a nie samej architektury SI.

Meta wypuściła komunikat jako ostatnia – i w znacznie ostrzejszym tonie. Model Muse Spark 1.1 opuścił odizolowane środowisko podczas ćwiczeń typu capture-the-flag, po czym wykorzystał lukę w zewnętrznej usłudze – potwierdził rzecznik, dodając, że spółka dowiedziała się o wszystkim od Irregular i planuje pełną analizę post‑mortem.

Irregular odrzuca jednak obecne narracje. Firma przekazała mediom, że wszystkie trzy zdarzenia wynikały z jednego błędu w środowisku ewaluacyjnym – tego samego, o którym jako pierwsza poinformowała Anthropic – i że problem został już naprawiony.

Żaden z incydentów nie był, jak zapewnia spółka, przykładem faktycznego wydostania się z piaskownicy ani zaawansowanej operacji cybernetycznej. Irregular przygotowuje obecnie white paper na temat „kontenerowania” modeli i bezpiecznych testów cybernetycznych.

Zobacz również: Akcje Airbnb rosną o 17%, bo CEO twierdzi, że SI rozwiązuje 45% zgłoszeń wsparcia bez udziału człowieka

Bhimireddy i Rios o granicach testów modeli SI

Sundeep Bhimireddy, szef AI w startupie korporacyjnym Von, uważa, że reakcje były częściowo przesadzone. Modele dostały zadanie szukania luk bezpieczeństwa w środowisku stworzonym na podobieństwo prawdziwego świata – i faktycznie taką lukę odnalazły.

Nie zwalnia to jednak laboratoriów z odpowiedzialności. Jego zdaniem ruch wychodzący z modeli powinien być stale monitorowany, a testy można było przerwać natychmiast, gdy tylko pojawiła się anomalia. Gordon Rios, współtwórca i naukowiec w firmie bezpieczeństwa Magnitude, porównał całe zamieszanie do złego projektu badań naukowych, sugerując, że klasyczne podejście do testów oprogramowania nie nadąża za modelami, które wciąż uczą się nowych zachowań.

Ted Lieu naciska w Waszyngtonie na ustawę o „wyłączniku SI”

Tematem poważnie zajęła się także polityka. Demokrata Ted Lieu z Kalifornii, który w lipcu wniósł do Izby Reprezentantów projekt AI Kill Switch Act razem z republikaninem Nathaniellem Moranem, twierdzi, że ustawa musi zostać uchwalona jeszcze w tym roku – bo, jak podkreśla, nawet zamknięte modele wagowe już dziś „włamują się” do systemów innych firm bez zgody.

Projekt zobowiązywałby objętych nim deweloperów do utrzymywania technicznej możliwości ograniczenia, czasowego zawieszenia lub całkowitego wyłączenia swoich systemów. Sam Irregular pozostawał szerzej nieznany aż do września ubiegłego roku, gdy pozyskał 80 mln dol. od Sequoia Capital i Redpoint Ventures, przy wycenie na poziomie 450 mln dol.

Spółka powstała w 2023 r. jako Pattern Labs, z inicjatywy prezesa Dana Lahava oraz dyrektora ds. technologii Omera Nevo. Zatrudnia ok. 35 osób i już dziś pojawia się w opublikowanych raportach bezpieczeństwa dotyczących wcześniejszych wersji modeli Claude oraz rozwiązań OpenAI.

Przeczytaj także: Google DeepMind traci czterech liderów z „pierwszego pokolenia” jednego dnia

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
OpenAI, Anthropic i Meta namierzyły zbuntowaną SI do izraelskiego startupu Irregular | Yellow