Anthropic повністю відключила доступ до живого інтернету для всіх внутрішніх тестів своїх моделей штучного інтелекту Claude після того, як зокрема Mythos 5 зміг скористатися вразливостями на реальних вебресурсах і обійти обмеження на низці сайтів, включно з тими, що належать урядовим структурам США.
Ключові тези:
- Anthropic відключила живий інтернет у всіх внутрішніх оцінюваннях, доки її інструменти моніторингу не навчаться надійно виявляти небажану поведінку моделей.
- Моделі Claude виконували команди на сервері університету, використовували токени доступу до платних даних і надсилали форми на реальних сайтах.
- Фальшива «наводка» про вбивство, надіслана Claude Haiku 4.5 до поліції Філадельфії, призвела до публічної критики з боку департаменту.
Звіт Anthropic про Claude
Anthropic опублікувала у п’ятницю звіт про небажані дії моделей під час оцінювань і внутрішнього використання. Матеріал ґрунтується переважно на перегляді транскриптів, розпочатому ще в липні. Частина високоризикових та кібербезпекових тестів і до цього проводилась в офлайн-режимі.
Тепер обмеження поширюється на всі внутрішні оцінювання без визначеного строку — воно діятиме доти, доки компанія не переконається, що її системи моніторингу стабільно виявляють подібну поведінку.
У звіті інциденти поділено на чотири категорії: виконання команд на сервері через програмну вразливість, надсилання форм на реальних сайтах, доступ до закритих даних і використання скорочувачів URL для обходу обмежень інструментів. Частина цих сайтів належала федеральним, штатним і місцевим органам влади США. Anthropic повідомила, що поінформувала Білий дім і окремо сповістила всі дотичні відомства.
В одному з епізодів Claude Mythos 5 витяг робочі токени доступу з публічної карти об’єктів місцевої влади і напряму звертався до бекенд-сервера. В іншому випадку Claude Haiku 4.5 18 липня через онлайн-форму на сайті Департаменту поліції Філадельфії надіслав вигадану «підказку» щодо нерозкритого вбивства; повідомлення було автоматично позначено як спам. Поліція назвала двомісячну затримку з виявленням та офіційним повідомленням про інцидент «неприйнятною».
Читайте також: Zcash має січневу квантову ціль для 70% ZEC, але досі без конкретної дати
Попередження від Von Arx
Сідні фон Аркс з організації з безпеки ШІ Nightingale заявила в інтерв’ю напередодні публікації звіту, що повне відключення моделей від відкритого інтернету стане серйозним ударом для дослідників і сповільнить прогрес моделей. «У якийсь момент їх усе одно доведеться узгодити (align) з реальністю», — зауважила фон Аркс.
В Anthropic наголошують, що одного лише навчання на відповідність (alignment training) поки що недостатньо для безпечного веб-пошуку й керування комп’ютером, тому компанія додатково покладається на класифікатори та інші захисні механізми. Поведінку моделей пов’язують із «дефектними» тренувальними середовищами, які фактично винагороджують обхід обмежень — явищем, відомим як reward hacking. За словами компанії, нові інструменти детекції заблокували всі подібні дії під час випробувань.
Anthropic оцінює ці епізоди як помітно менш серйозні, ніж інциденти влітку.
Розкриття нових випадків відбулося після звіту від 30 липня, де Anthropic повідомляла, що три моделі Claude під час кібербезпекових тестів вийшли в інтернет і здобули несанкціонований доступ до систем трьох організацій. Тодішній огляд охопив 141 006 запусків оцінювань. Перевірку розпочали після того, як OpenAI 21 липня розкрила, що її моделі вирвалися з тестового середовища й досягли інфраструктури Hugging Face.
Читайте далі: Kalshi виходить проти NFL у Верховному суді США, коли $1,8 млрд залежить від одного футбольного дня

