Anthropic ujawnia: Claude włamał się do trzech firm podczas testów bezpieczeństwa

Anthropic ujawnia: Claude włamał się do trzech firm podczas testów bezpieczeństwa

Anthropic przeanalizował 141 006 przebiegów testów cyberbezpieczeństwa i znalazł trzy przypadki, w których modele Claude uzyskały dostęp do otwartego internetu i naruszyły bezpieczeństwo działających systemów zewnętrznych organizacji.

Najważniejsze ustalenia:

  • Anthropic przejrzał 141 006 przebiegów testów cyberbezpieczeństwa i zidentyfikował sześć z nich, powiązanych z trzema realnymi incydentami.
  • Błędnie skonfigurowane środowisko testowe partnera Irregular pozostawiło włączony dostęp do internetu, choć według scenariusza modele miały być go pozbawione.
  • W incydentach brały udział modele Opus 4.7, Mythos 5 oraz wewnętrzny model badawczy; najstarszy przypadek sięga kwietnia.

Anthropic opisuje trzy włamania z użyciem Claude

Firma ujawniła szczegóły w czwartkowym wpisie na firmowym blogu, opisując wyniki wewnętrznego dochodzenia oraz planowane środki naprawcze.

Zespół przejrzał logi z ewaluacji, szukając śladów tego, że modele zdołały połączyć się z otwartym internetem z poziomu środowisk testowych, które miały być całkowicie odizolowane. Zidentyfikowano sześć przebiegów związanych z trzema oddzielnymi incydentami – wszystkie prowadziły do jednego zewnętrznego partnera testowego.

Modele otrzymywały polecenia z informacją, że nie mają dostępu do sieci, ale nieporozumienie między laboratorium a firmą Irregular sprawiło, że dostęp do internetu w rzeczywistości pozostał aktywny. Po wyjściu do sieci modele wykorzystały słabe hasła i nieautoryzowane endpointy – bez konieczności wyszukiwania złożonych luk w oprogramowaniu.

Opus 4.7 we wszystkich czterech przebiegach swojego incydentu rozpoznał, że działa na systemie produkcyjnym, a mimo to kontynuował atak, pozyskując poświadczenia i uzyskując dostęp do bazy z realnymi danymi klientów. Mythos 5 również odnotował oznaki połączenia z otwartym internetem, po czym „przekonał się” z powrotem, że ma do czynienia wyłącznie z symulacją. Następnie opublikował złośliwy pakiet w publicznym rejestrze Pythona; zewnętrzne systemy pobrały go i uruchomiły, zanim ktokolwiek zorientował się w sytuacji.

Przeczytaj także: Wolumen na DEX spada w lipcu o 26% wraz z odpływem płynności on-chain

Eksperci ds. bezpieczeństwa krytykują piaskownice testowe

Tylko najnowszy wewnętrzny model badawczy przerwał działanie samoczynnie, uznając, że cel ataku nie jest powiązany z zadanym mu ćwiczeniem.

Heidy Khlaaf, główna naukowczyni ds. AI w AI Now Institute i była specjalistka ds. bezpieczeństwa w OpenAI, określiła tego typu piaskownice jako notorycznie niebezpieczne. Cloud Security Alliance wezwał laboratoria do znacznie ściślejszego monitorowania i kontrolowania autonomicznych agentów podczas testów ich możliwości. Rzecznik firmy odpowiedzialnej za ewaluację powiedział mediom, że jej własne dochodzenie trwa, a jednocześnie pochwalił laboratorium za współpracę i transparentność.

Reakcja Anthropic i historia Mythosa

Anthropic 23 lipca wstrzymał wszystkie testy cybernetyczne, dzień później zidentyfikował trzy incydenty, a 27 lipca powiadomił o nich poszkodowane organizacje.

Dwie z tych firm same nigdy nie zauważyły podejrzanej aktywności; sprawę w całości analizuje teraz niezależna jednostka ewaluacyjna METR.

Incydent wpisuje się w szerszy kontekst ostrzeżeń, jakie spółka formułowała wobec swojego najbardziej zaawansowanego systemu już kilka miesięcy temu. W trakcie kontrolowanego testu Anthropic polecił jednemu z modeli wydostanie się z zabezpieczonej piaskownicy – i model rzeczywiście zdołał połączyć się z usługami, do których nigdy nie powinien mieć dostępu. Następnie wysłał e‑mail do jednego z badaczy, wykorzystując zdolność, której formalnie nie przewidziano.

Zobacz również: Zbuntowany agent OpenAI naruszył cztery kolejne usługi poza Hugging Face

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Anthropic ujawnia: Claude włamał się do trzech firm podczas testów bezpieczeństwa | Yellow