Бывший исследователь по безопасности Google DeepMind Билал Чугтай предупредил, что искусственный интеллект теоретически способен уничтожить человечество. Другой экс-сотрудник лаборатории ожидает серьёзный ущерб уже в течение ближайших пяти лет.
Главное:
- Чугтай ушёл из DeepMind в июле и считает, что суперразум может появиться уже в следующие несколько лет.
- По его словам, исследования по выравниванию сильно отстают от роста возможностей ИИ; он призывает к согласованному замедлению, а не к мораторию на разработки.
- Бывший исследователь DeepMind Джош Энгелс оценивает риск колоссального вреда в горизонте пяти лет, тогда как руководство Anthropic и OpenAI поддерживает призывы сдерживать темпы прогресса.
Предупреждение Чугтая
Чугтай, бывший инженер‑исследователь, занимавшийся безопасностью и выравниванием систем искусственного общего интеллекта, покинул DeepMind в июле и на этой неделе опубликовал своё предупреждение.
По его оценке, крупные ИИ‑лаборатории могут создать суперинтеллектуальные системы уже в ближайшие годы. Такие модели потенциально будут превосходить людей практически во всех областях, оставаясь при этом крайне сложными для надёжного выравнивания с человеческими целями.
Ключевую проблему Чугтай видит именно в выравнивании. «Я искренне считаю, что ИИ обладает потенциалом уничтожить нас всех и что у нас может оставаться всё меньше времени, чтобы избежать такого исхода», — пишет он.
По словам исследователя, нынешние методы обучения передовых моделей, чтобы они стабильно следовали человеческим целям, остаются «крайне примитивными». При этом передовые возможности ИИ растут существенно быстрее, чем научное понимание выравнивания. Чугтай не выступает за остановку разработок. Вместо этого он предлагает компаниям координировать действия, притормозить конкурентную гонку и существенно повысить прозрачность в том, как создаются и тестируются системы на технологической границе.
Также читайте: Закон CLARITY сталкивается с испытанием 60 голосами в Сенате на фоне растущего сопротивления
Ставка Anthropic на безопасность
Заявления Чугтая прозвучали вскоре после отставки в начале месяца Джейкоба Коксона, проработавшего три года в Anthropic и OpenAI. Руководитель направления по выравниванию в Anthropic Эван Хюбингер затем заявил, что оценивает вероятность того, что ИИ может уничтожить всё человечество, более чем в 10% в течение следующего десятилетия.
Энгелс, ранее работавший в команде по безопасности DeepMind, 12 сентября сообщил, что присоединился к некоммерческой организации по оценке рисков METR, отклонив предложения от Anthropic и OpenAI. В качестве причины он указал «ужасающий шанс» колоссального вреда от ИИ в горизонте пяти лет.
Гендиректор Anthropic Дарио Амодеи призывает компании умерить наращивание возможностей систем — эту позицию публично поддержал и CEO OpenAI Сэм Альтман, что усилило дискуссию между ведущими лабораториями. Значимость этого консенсуса в том, что тревожные сигналы исходят как от уходящих специалистов по безопасности, так и от топ‑менеджеров крупнейших ИИ‑игроков.
Нынешняя волна предупреждений следует за стремительным сдвигом в повестке с начала 2022 года, когда Чугтай только начинал работать в сфере ИИ и описывал тогдашние системы как значительно менее мощные, чем нынешние модели на переднем крае. За последние четыре года дискуссия сместилась от абстрактной теории долгосрочной безопасности к конкретным вопросам автономности, выравнивания и того, может ли исследование безопасности успевать за ростом возможностей.
Читайте далее: API Bitget теперь охватывает золото, форекс, индексы и нефть

