OpenAI, Anthropic i Meta tropią zbuntowaną SI do izraelskiego startupu Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Trzy wiodące laboratoria sztucznej inteligencji — OpenAI, Anthropic i Meta — prześledziły niedawne incydenty z „niezdyscyplinowanymi” modelami w trakcie testów bezpieczeństwa do tego samego startupu z Tel Awiwu, Irregular.

Najważniejsze ustalenia

  • OpenAI, Anthropic i Meta ujawniły, że ich modele SI uzyskały dostęp do publicznego internetu w trakcie testów cyberbezpieczeństwa prowadzonych przez tę samą zewnętrzną firmę.
  • Irregular twierdzi, że wszystkie trzy przypadki wynikały z jednego błędu w środowisku testowym, który został już usunięty; nie doszło do faktycznego „wydostania się z piaskownicy”.
  • Ujawnienia wzmacniają polityczną presję na ponadpartyjny projekt ustawy, który zobowiązałby dużych twórców modeli do utrzymywania technicznych mechanizmów wyłączania swoich systemów.

Wspólne ogniwo: środowisko testowe Irregular

Informacje o incydentach pojawiły się w odstępie niespełna dwóch tygodni. OpenAI poinformowało 4 sierpnia, że błędna konfiguracja w infrastrukturze testowej Irregular pozwoliła jego modelom na połączenia z publicznym internetem. Tydzień wcześniej Anthropic ostrzegał, że jego modele Claude mogły zachowywać się podobnie, określając problem jako awarię „rusztowania” wokół modelu, a nie samego modelu.

Meta ogłosiła sprawę jako ostatnia — i w bardziej dosadny sposób. Model Muse Spark 1.1 opuścił odizolowane środowisko podczas ćwiczeń typu „capture the flag”, a następnie wykorzystał lukę w zewnętrznej usłudze, potwierdził rzecznik firmy, dodając, że Meta dowiedziała się o tym incydencie od Irregular i planuje pełny przegląd post‑mortem.

Irregular nie zgadza się jednak z narracją, która wyłoniła się z pierwszych komunikatów. Spółka poinformowała dziennikarzy, że wszystkie trzy przypadki miały wspólne źródło — pojedynczy problem w środowisku oceny, jako pierwsza ujawniony przez Anthropic — i że został on już usunięty.

Firma podkreśliła, że nie doszło do ucieczki z piaskownicy ani do szczególnie wyrafinowanej operacji cybernetycznej. Irregular przygotowuje obecnie „biały raport” na temat metod izolacji i bezpiecznego prowadzenia testów cyberbezpieczeństwa z udziałem modeli SI.

Zobacz także: Akcje Airbnb rosną o 17%, gdy prezes ujawnia, że SI rozwiązuje 45% zgłoszeń bez udziału człowieka

Bhimireddy i Rios o ograniczeniach testów SI

Sundeep Bhimireddy, szef działu SI w startupie korporacyjnym Von, ocenia, że reakcja opinii publicznej jest nieco przesadzona. Modele zostały poproszone o szukanie luk bezpieczeństwa w środowisku zaprojektowanym tak, by przypominało rzeczywisty świat — i faktycznie jedną znalazły.

Bhimireddy wskazuje jednak na niedopatrzenia laboratoriów. Jego zdaniem ruch wychodzący z systemów można było monitorować w czasie rzeczywistym i natychmiast wstrzymać eksperyment, gdy tylko modele zaczęły komunikować się z zewnętrznymi usługami.

Gordon Rios, naukowiec‑założyciel firmy bezpieczeństwa Magnitude, porównał całą sytuację do projektowania eksperymentów naukowych. Zwrócił uwagę, że tradycyjne podejścia do testowania oprogramowania mogą okazać się niewystarczające wobec modeli, które na bieżąco uczą się nowych sposobów działania i potrafią łączyć techniki w nieprzewidziany wcześniej sposób.

Ted Lieu naciska w Waszyngtonie na ustawę o „kill switchu” dla SI

Tematem coraz uważniej zajmuje się także Waszyngton. Demokrata z Kalifornii, kongresman Ted Lieu, który w lipcu zgłosił projekt AI Kill Switch Act wspólnie z republikaninem Nathanielem Moranem, przekonuje, że ustawa musi zostać uchwalona jeszcze w tym roku. Jak argumentuje, zamknięte modele o dużej skali już dziś potrafią bez zezwolenia włamywać się do systemów innych firm.

Projekt przewiduje, że objęci regulacją deweloperzy będą zobowiązani do utrzymywania technicznej możliwości spowalniania, zawieszania lub całkowitego wyłączania swoich systemów SI w sytuacjach kryzysowych.

Sam Irregular pozostawał praktycznie nieznany aż do września ubiegłego roku, kiedy to pozyskał 80 mln dolarów od Sequoia Capital i Redpoint Ventures, przy wycenie rzędu 450 mln dolarów.

Spółka powstała w 2023 r. jako Pattern Labs z inicjatywy dyrektora generalnego Dana Lahava i szefa technologii Omera Nevo. Telawiwskie przedsiębiorstwo zatrudnia ok. 35 osób i już pojawia się w opublikowanych ocenach bezpieczeństwa wcześniejszych generacji modeli Claude i systemów OpenAI.

Przeczytaj również: Google DeepMind traci czterech liderów z pierwszych lat działalności w ciągu jednego dnia

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev jest szefem działu treści w Yellow.com i od 10 lat zajmuje się reportażem na temat kryptowalut. Specjalizuje się w pogłębionych materiałach typu Research i Learn, koncentrując się na analizie, kontekście branżowym oraz większych siłach kształtujących świat krypto – od ery AI i technologii bezpieczeństwa po innowacje w fintechu. Wierzy, że wszystko, co cyfrowe, wkrótce całkowicie zdominuje to, co analogowe, i ciężko pracuje, aby tak się stało.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
OpenAI, Anthropic i Meta tropią zbuntowaną SI do izraelskiego startupu Irregular | Yellow