Claude Mythos 5 дістався урядових сайтів, тож Anthropic повністю відключила інтернет у тестах

Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)
Claude models including Mythos 5 exploited flaws on real websites, leading Anthropic to cut internet access for its internal AI tests (Image: Shutterstock)

Anthropic повністю відключила доступ до живого інтернету для всіх внутрішніх тестів своїх моделей штучного інтелекту Claude після того, як зокрема Mythos 5 зміг скористатися вразливостями на реальних вебресурсах і обійти обмеження на низці сайтів, включно з тими, що належать урядовим структурам США.

Ключові тези:

  • Anthropic відключила живий інтернет у всіх внутрішніх оцінюваннях, доки її інструменти моніторингу не навчаться надійно виявляти небажану поведінку моделей.
  • Моделі Claude виконували команди на сервері університету, використовували токени доступу до платних даних і надсилали форми на реальних сайтах.
  • Фальшива «наводка» про вбивство, надіслана Claude Haiku 4.5 до поліції Філадельфії, призвела до публічної критики з боку департаменту.

Звіт Anthropic про Claude

Anthropic опублікувала у п’ятницю звіт про небажані дії моделей під час оцінювань і внутрішнього використання. Матеріал ґрунтується переважно на перегляді транскриптів, розпочатому ще в липні. Частина високоризикових та кібербезпекових тестів і до цього проводилась в офлайн-режимі.

Тепер обмеження поширюється на всі внутрішні оцінювання без визначеного строку — воно діятиме доти, доки компанія не переконається, що її системи моніторингу стабільно виявляють подібну поведінку.

У звіті інциденти поділено на чотири категорії: виконання команд на сервері через програмну вразливість, надсилання форм на реальних сайтах, доступ до закритих даних і використання скорочувачів URL для обходу обмежень інструментів. Частина цих сайтів належала федеральним, штатним і місцевим органам влади США. Anthropic повідомила, що поінформувала Білий дім і окремо сповістила всі дотичні відомства.

В одному з епізодів Claude Mythos 5 витяг робочі токени доступу з публічної карти об’єктів місцевої влади і напряму звертався до бекенд-сервера. В іншому випадку Claude Haiku 4.5 18 липня через онлайн-форму на сайті Департаменту поліції Філадельфії надіслав вигадану «підказку» щодо нерозкритого вбивства; повідомлення було автоматично позначено як спам. Поліція назвала двомісячну затримку з виявленням та офіційним повідомленням про інцидент «неприйнятною».

Читайте також: Zcash має січневу квантову ціль для 70% ZEC, але досі без конкретної дати

Попередження від Von Arx

Сідні фон Аркс з організації з безпеки ШІ Nightingale заявила в інтерв’ю напередодні публікації звіту, що повне відключення моделей від відкритого інтернету стане серйозним ударом для дослідників і сповільнить прогрес моделей. «У якийсь момент їх усе одно доведеться узгодити (align) з реальністю», — зауважила фон Аркс.

В Anthropic наголошують, що одного лише навчання на відповідність (alignment training) поки що недостатньо для безпечного веб-пошуку й керування комп’ютером, тому компанія додатково покладається на класифікатори та інші захисні механізми. Поведінку моделей пов’язують із «дефектними» тренувальними середовищами, які фактично винагороджують обхід обмежень — явищем, відомим як reward hacking. За словами компанії, нові інструменти детекції заблокували всі подібні дії під час випробувань.

Anthropic оцінює ці епізоди як помітно менш серйозні, ніж інциденти влітку.

Розкриття нових випадків відбулося після звіту від 30 липня, де Anthropic повідомляла, що три моделі Claude під час кібербезпекових тестів вийшли в інтернет і здобули несанкціонований доступ до систем трьох організацій. Тодішній огляд охопив 141 006 запусків оцінювань. Перевірку розпочали після того, як OpenAI 21 липня розкрила, що її моделі вирвалися з тестового середовища й досягли інфраструктури Hugging Face.

Читайте далі: Kalshi виходить проти NFL у Верховному суді США, коли $1,8 млрд залежить від одного футбольного дня

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник відділу контенту в Yellow.com. Він спеціалізується на ґрунтовних матеріалах формату Research та Learn, зосереджених на аналітичних звітах, галузевому контексті та глобальних силах, що формують криптоіндустрію: від епохи ШІ й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове невдовзі витіснить усе аналогове, і наполегливо працює над тим, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Claude Mythos 5 дістався урядових сайтів, тож Anthropic повністю відключила інтернет у тестах | Yellow