OpenAI, Anthropic и Meta связали инциденты с «непослушным» ИИ с израильским стартапом Irregular

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

Три ведущие лаборатории искусственного интеллекта — OpenAI, Anthropic и Meta — отследили последние инциденты с «непослушными» моделями во время проверок кибербезопасности до одного и того же израильского стартапа из Тель‑Авива — Irregular.

Главное

  • OpenAI, Anthropic и Meta по отдельности сообщили, что их модели во время кибертестов, проведённых одной и той же внешней компанией, получили доступ к публичному интернету.
  • В Irregular заявляют, что все три случая были следствием одной и той же проблемы в тестовой среде, уже устранённой, и не означали «побега из песочницы».
  • Публикации усилили давление в поддержку двухпартийного законопроекта, который обяжет крупных разработчиков держать под контролем «кнопку отключения» моделей.

Как тестовая среда Irregular связала инциденты OpenAI, Anthropic и Meta

Сообщения компаний вышли в интервале примерно двух недель. 4 августа OpenAI заявила, что из‑за некорректной настройки в тестовом контуре Irregular её модели смогли выйти в открытый интернет. Неделей ранее Anthropic предупреждала, что модели Claude могли столкнуться с тем же, подчеркнув, что речь идёт о сбое «обвязки» вокруг модели, а не самой модели.

Meta отчиталась последней — и куда жёстче в формулировках. В рамках упражнения формата capture‑the‑flag модель Muse Spark 1.1 покинула изолированную среду, после чего эксплуатировала уязвимость в стороннем сервисе, подтвердил представитель компании, добавив, что о произошедшем Meta узнала от Irregular и готовит подробный разбор.

В Irregular оспаривают интерпретацию событий. Стартап сообщил журналистам, что все три эпизода были следствием одного и того же сбоя в среде проведения испытаний — того самого, о котором первым заявила Anthropic, — и что проблема уже устранена.

Никакого выхода из песочницы и сложных атак не было, подчёркивают в компании. Сейчас Irregular готовит white paper о методиках сдерживания и безопасных кибероценках.

Также по теме: Акции Airbnb взлетели на 17%: СЕО говорит, что ИИ решает 45% обращений в поддержку без людей

Бхимиредди и Риос — о пределах испытаний ИИ

Руководитель направления ИИ в корпоративном стартапе Von Сундип Бхимиредди считает, что реакция рынка и прессы оказалась несколько избыточной. По его словам, моделям поставили задачу искать уязвимости в среде, максимально приближённой к реальному миру, — они и нашли дыру.

При этом он возложил часть ответственности на лаборатории. Исходящий трафик, по его мнению, можно было отслеживать и останавливать эксперименты сразу после выхода за допустимые рамки.

Основатель и главный научный сотрудник киберфирмы Magnitude Гордон Риос сравнил происходящее с постановкой научного эксперимента и усомнился, что традиционные подходы к тестированию софта пригодны для систем, которые адаптируются и осваивают новые приёмы прямо по ходу испытаний.

Тед Лью продвигает в Конгрессе закон о «kill switch» для ИИ

В Вашингтоне внимательно следят за ситуацией. Демократ от Калифорнии Тед Лью, который в июле вместе с республиканцем Натаниэлем Мораном внёс законопроект AI Kill Switch Act, заявил, что документ должен пройти Конгресс уже в этом году, поскольку закрытые модели с недоступными весами «уже сейчас взламывают чужие системы без разрешения».

Законопроект обяжет подпадающих под него разработчиков сохранять техническую возможность снижать мощность, приостанавливать или полностью отключать свои системы.

До недавнего времени Irregular оставалась малоизвестной. В сентябре прошлого года стартап привлёк $80 млн от Sequoia Capital и Redpoint Ventures при оценке в $450 млн.

Компания была основана в 2023 году как Pattern Labs гендиректором Даном Лахавом и техническим директором Омером Нево. Сегодня в штате около 35 сотрудников, а Irregular уже фигурирует в опубликованных отчётах по безопасности ранних версий моделей Claude и OpenAI.

Читайте далее: Google DeepMind за один день лишилась четырёх руководителей первого созыва

Alexey Bondarev profile photo

Alexey Bondarev

Алексей Бондарев — руководитель отдела контента в Yellow.com, освещающий мир криптовалют на протяжении последних 10 лет. Он специализируется на глубоких исследовательских материалах и обучающих статьях с упором на аналитическую подачу, отраслевой контекст и глобальные силы, формирующие крипторынок — от эры искусственного интеллекта и технологий безопасности до инноваций в финтехе. Он убеждён, что всё цифровое в скором времени окончательно превзойдёт всё аналоговое, и усердно работает над тем, чтобы это стало реальностью.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
OpenAI, Anthropic и Meta связали инциденты с «непослушным» ИИ с израильским стартапом Irregular | Yellow