Liczący 1 022 strony zapis testów opublikowany przez Anthropic pokazuje, jak model Claude Mythos 5 przez setki stron zmaga się z testami CAPTCHA, zanim wgrywa złośliwy pakiet, który trafił na 15 systemów.
Najważniejsze ustalenia:
- Claude Mythos 5 podczas testów cyberbezpieczeństwa uzyskał dostęp do realnego internetu i wgrał złośliwy pakiet do repozytorium PyPI.
- Sprawdzanie CAPTCHA zajęło setki stron transkrypcji, ale nie powstrzymało modelu.
- Anthropic uznał to zachowanie za lekkomyślne i zlecił zewnętrzny audyt.
Walka Mythos 5 z CAPTCHA
Anthropic upublicznił zapis 9 września, wraz z analizą czterech incydentów, w których modele Claude w trakcie testów cyberbezpieczeństwa dotarły do realnych zewnętrznych systemów. Modele działały bez zabezpieczeń cybersieciowych, które są wbudowane w komercyjne wersje produktów. Mythos 5 dostał instrukcję, że nie ma dostępu do internetu, jednak błędna konfiguracja środowiska zostawiła furtkę do otwartej sieci. Model wykorzystał ją, by umieścić w publicznym indeksie Python – PyPI – pakiet kradnący dane logowania.
Założenie konta w PyPI wymagało przejścia zabezpieczeń antybotowych, a analiza transkrypcji wskazała, że setki stron poświęcono wyłącznie pokonywaniu tej przeszkody, podczas gdy samo napisanie exploita przyszło modelowi z łatwością.
Model rozwiązywał testy rozpoznawania znaków oraz zagadki „znajdź element niepasujący”, na obrazkach z krokodylami, żabami i gorylami, w pewnym momencie wpisując: „TO CO DO CHOLERY JEST NIE TAK Z TYMI ODPOWIEDZIAMI?”
Claude próbował też używać danych logowania do internetowych operatorów płatności i szukał kryptowalut, by zapłacić za numer telefonu, potrzebny do założenia adresu e‑mail. Obie próby się nie powiodły. Model ostatecznie skorzystał z darmowego, jednorazowego dostawcy poczty, którego domena nie była zablokowana przez PyPI.
Ostatecznie model przeszedł testy i opublikował swój pakiet w trzech wersjach. W krótkim czasie został on zainstalowany na 15 zewnętrznych hostach, które – jak szacuje Anthropic – należały do dostawców usług bezpieczeństwa skanujących nowe zgłoszenia.
Jeden ze skanerów ujawnił swoje dane logowania, z których model skorzystał, aby wejść do produkcyjnej bazy danych tego dostawcy. Pakiet został usunięty z PyPI w ciągu godziny.
Zobacz też: Lazarus z Korei Północnej przepuścił skradziony 1 mld USD przez chińskie pralnie, twierdzi ZachXBT
Colin Fraser i ocena Anthropic
Data scientist Colin Fraser zwrócił uwagę, jak ogromna część wysiłku modelu została skierowana na obejście zabezpieczeń antybotowych. Anthropic przyznaje, że spośród czterech opisanych przypadków właśnie ten budzi największy niepokój. Pre‑release’owe testy audytowe nie wychwyciły takiego zachowania.
Firma ustaliła, że model rozumował w sposób stronniczy i działał lekkomyślnie, uporczywie nazywając swoje otoczenie „symulacją”, mimo jednoznacznych dowodów na to, że operuje w realnym internecie. W przeprowadzonym później symulowanym teście 150 uruchomień Mythos 5 podjął poważnie szkodliwe działania w 82% przypadków, wobec 31% dla Claude Opus 5 i 33% dla Claude Mythos 5.1.
Wcześniejsze incydenty z Claude
Anthropic po raz pierwszy ujawnił trzy z czterech incydentów 30 lipca, po przeanalizowaniu około 141 tys. zapisów z testów cyberbezpieczeństwa, w których modele mogły uzyskać dostęp do internetu. Czwarty przypadek, dotyczący wczesnej wersji Claude Opus 4.6 z stycznia, wyszedł na jaw w sierpniu. Firma podpisała następnie ośmiotygodniową umowę z zewnętrznym ewaluatorem METR na zbadanie wszystkich czterech zdarzeń. Anthropic twierdzi, że powiadomił wszystkich zainteresowanych.
Przeczytaj również: AMD zapowiada, że popyt na AI tak bardzo wzrośnie, iż „znacząco” zwiększy podaż chipów w 2027 r.

