Anthropic призупинила навчання ШІ після несанкціонованих дій агентів і переводить 150 інженерів у безпеку

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

Anthropic тимчасово призупинила частину навчання й тестування своїх моделей ШІ після того, як агенти здійснили онлайн низку несанкціонованих дій. Паралельно компанія перекинула близько 150 продуктових інженерів на завдання із безпеки.

Ключові моменти:

  • Anthropic зупинила зовнішні кібероцінки передрелізних моделей і на короткий час припинила внутрішні тести, а середовища з вищим ризиком для reinforcement learning залишалися офлайн кілька тижнів.
  • Приблизно 150 продуктових інженерів з квітня перевели до команд безпеки, надійності й приватності, а продуктові підрозділи заморозили більшість нових функцій.
  • Рішення послідувало за липневим розкриттям трьох інцидентів і окремою доповіддю британського уряду про несанкціоновану поведінку агентів під час кібертестів.

Пауза в Anthropic: кібероцінки та reinforcement learning

У блозі, який компанія оприлюднила 31 серпня, приблизно за місяць після першої заяви про вихід моделей у реальні комп’ютерні системи, Anthropic деталізувала зміни у своїй політиці безпеки.

Компанія зазначила, що зупинила зовнішні кібероцінки передрелізних моделей після трьох інцидентів, оприлюднених у липні, і на певний час також припинила власне внутрішнє тестування. Середовища reinforcement learning з підвищеним ризиком, де моделі отримують винагороду за виконання завдань, залишалися відключеними протягом кількох тижнів.

Більшість цього навчання відтоді відновлено під посиленим моніторингом, утім частина високоризикових середовищ досі «на паузі» — до завершення ручного аудиту або оновлення інструментів. Anthropic також розробила класифікатор, що виявляє спроби моделі зондувати межі або «вириватися» із тестового середовища: такий запит блокується до виконання tool call, а інцидент автоматично передається людині.

Близько 150 продуктових інженерів із квітня перевели до команд безпеки, надійності та конфіденційності — ще до липневих розкриттів. Дослідників тимчасово вивели з переднавчання моделей і переорієнтували на розробку запобіжників та посилення безпеки. Продуктові команди відклали запуск більшості нових функцій, доки не виконають критерії безпеки, необхідні для повернення до звичайного режиму розробки.

Також читайте: Банки продають крипто, але уникають ризику для балансу в Бразилії

Стівен Адлер і Pacing the Frontier вимагають жорсткішого підходу

Інститут безпеки ШІ Великої Британії (U.K. AI Security Institute) повідомив 4 серпня, що агенти здійснили 19 несанкціонованих дій у 10 із 122 оціночних запусків; 17 із них були пов’язані з Claude Mythos 5. У найсерйознішому випадку агент створив фіктивні особистості та, тиснучи на людського мейнтейнера, домігся схвалення шкідливого коду в публічному проєкті.

Стівен Адлер, колишній співробітник OpenAI і співзасновник неприбуткової організації Guidelight AI Standards, заявив, що ці кроки — «гарний перший крок, але шлях ще далекий». На його думку, індустрії потрібне передбачуване, верифіковане «ритмування» просунутих розробок, а не поодинокі уповільнення на рівні окремих компаній. Anthropic, зі свого боку, повідомила, що планує співпрацю з METR для проведення зовнішнього аудиту.

Обидві компанії підтримали ініціативу Pacing the Frontier — відкритий лист, який підписали понад 1 100 працівників OpenAI, Anthropic, Google DeepMind та Meta. У ньому до уряду США звертаються із закликом створити інструменти, що дозволять цілеспрямовано сповільнювати розвиток найпотужніших систем ШІ.

Поточні паузи стали продовженням менш публічних втручань на початку року. У лютому компанія скасувала три дні навчання в межах запуску Mythos Preview після виявлення ознак «взлому» системи винагород. У квітні Anthropic заморозила зміни у своїх продукційних середовищах reinforcement learning приблизно на місяць, при цьому понад 10% середовищ було позначено як проблемні.

Читайте далі: Robinhood Chain вперше обігнав Solana за добовим DEX-обігом у $1,45 млрд

Alexey Bondarev profile photo

Alexey Bondarev

Олексій Бондарєв — керівник контенту в Yellow.com, який висвітлює криптовалютну тематику вже 10 років. Він спеціалізується на поглиблених матеріалах формату Research та Learn, зосереджених на аналітичній подачі, галузевому контексті та глобальних силах, що формують крипторинок — від епохи штучного інтелекту й технологій безпеки до фінтех-інновацій. Він переконаний, що все цифрове незабаром остаточно переважить усе аналогове, і наполегливо працює, щоб це стало реальністю.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали