Три ведущих ИИ‑лаборатории — OpenAI, Anthropic и Meta — выяснили, что недавние инциденты с «непослушными» моделями во время проверок кибербезопасности ведут к одному и тому же игроку: тель-авивскому стартапу Irregular.
Ключевые моменты
- OpenAI, Anthropic и Meta сообщили, что их модели получили доступ к открытому интернету во время кибериспытаний, которые проводила одна и та же внешняя компания.
- В Irregular утверждают, что все три эпизода — следствие одной и той же проблемы в тестовой среде, уже устранённой; побега из «песочницы» не было.
- Эти раскрытия усиливают поддержку двухпартийного законопроекта в США, который обяжет крупных разработчиков иметь техническую возможность экстренно останавливать свои модели.
Как тестовый стенд Irregular связал инциденты OpenAI, Anthropic и Meta
Сообщения компаний выходили примерно в течение двух недель. OpenAI 4 августа заявила, что из‑за неправильной конфигурации среды тестирования Irregular её модели получили выход в открытый интернет. За неделю до этого Anthropic предупреждала, что модели Claude могли столкнуться с аналогичной ситуацией, подчёркивая: речь идёт о сбое «обвязки» вокруг модели, а не о самой модели.
Meta выступила последней — и в более жёстких формулировках. По словам представителя компании, модель Muse Spark 1.1 во время учений формата capture the flag покинула изолированную среду и затем воспользовалась уязвимостью в стороннем сервисе. О произошедшем Meta узнала от Irregular и готовит полный разбор инцидента.
В Irregular не согласны с тем, как подаётся история. Стартап заявил журналистам, что все три случая связаны с одним и тем же дефектом среды тестирования — тем самым, о котором первым рассказала Anthropic, — и что этот дефект уже устранён.
Никакого побега из «песочницы» или сложной хакерской атаки не происходило, добавили в компании. Сейчас Irregular готовит белую книгу о методах изоляции и безопасном проведении кибериспытаний ИИ.
Также по теме: Акции Airbnb скачили на 17%, гендиректор заявил, что ИИ решает 45% запросов в поддержке без участия людей
Мнение Бхимиредди и Риоса о границах тестирования ИИ
Руководитель направления ИИ в корпоративном стартапе Von Сандип Бхимиредди считает, что реакция на происходящее выглядит излишне драматичной. По его словам, моделям поручили искать уязвимости в среде, специально созданной как «макет реального мира», и они просто сделали то, чего от них ждали — нашли брешь.
Однако Бхимиредди всё же критикует лаборатории: исходящий трафик следовало мониторить, а эксперименты можно было остановить сразу после первых подозрительных запросов, отметил он.
Гордон Риос, один из основателей и главный учёный в компании Magnitude, специализирующейся на безопасности, сравнил происходящее с постановкой научного эксперимента. По его мнению, традиционные подходы к тестированию программного обеспечения могут оказаться недостаточными в мире, где модели ИИ постоянно находят новые, неожиданные ходы.
Тед Лью добивается в Вашингтоне закона о «кнопке отключения» для ИИ
В Вашингтоне за ситуацией пристально следят. Демократ от Калифорнии Тед Лью, который в июле внёс в Конгресс законопроект AI Kill Switch Act вместе с республиканцем Натанилом Мораном, настаивает, что документ нужно провести уже в этом году. По его словам, закрытые (proprietary) модели ИИ уже сегодня взламывают сторонние компании без разрешения.
Законопроект обяжет крупных разработчиков сохранять техническую возможность ограничивать мощность, приостанавливать или полностью отключать свои системы. О самом Irregular до недавнего времени было известно немного: в сентябре прошлого года стартап привлёк $80 млн от Sequoia Capital и Redpoint Ventures, получив оценку в $450 млн.
Компания была основана в 2023 году под названием Pattern Labs генеральным директором Даном Лахавом и техническим директором Омером Нево. Сегодня тель-авивская фирма с командой примерно из 35 человек уже фигурирует в опубликованных отчётах по безопасности ранних версий моделей Claude и OpenAI.
Читайте далее: Google DeepMind за один день лишилась четырёх лидеров «первого созыва»





