Троє дослідників, звільнених із OpenAI, у листі до ради директорів від 7 жовтня закликали компанію зупинити розробки, які роблять ШІ важчим для нагляду. Внутрішня службова записка компанії фактично підтримала ці рекомендації.
Ключові факти:
- Троє звільнених співробітників OpenAI 7 жовтня надіслали раді директорів лист із вимогою припинити роботи, що послаблюють можливість моніторингу ШІ.
- В OpenAI заявили, що звільнення не пов’язані з питаннями безпеки, а внутрішня записка керівника досліджень різко підтримала пропозиції з листа.
- Системна карта GPT-6 Astra вказує, що цю модель OpenAI важче моніторити, ніж GPT-5.6 Sol.
Що було в листі до ради OpenAI
Томек Корбак (Tomek Korbak), Мікіта Балесні (Mikita Balesni) та Жасмін Ван (Jasmine Wang), які займалися в компанії безпекою та узгодженістю моделей, адресували свій лист раді директорів OpenAI та її комітетам з безпеки, згідно з уривками, опублікованими у середу.
Повний текст листа поки що не розкривають. У ньому дослідники пишуть, що «індустрія ще не знає, як безпечно розробляти та розгортати моделі, які ми не можемо моніторити».
Вони наголошують, що OpenAI та її конкуренти мають утриматися від напрямів роботи, які ще більше зменшують цю здатність. За повідомленнями, у листі також міститься заклик залучити незалежних аудиторів і розвивати відкриту, прозору екосистему безпеки. Звільнення, йдеться в документі, «охолоджують тих, хто залишився працювати в OpenAI».
Також читайте: CrowdStrike підозрює 26-річного китайського хакера в атаках на корейські банки за допомогою Claude Code
Записка OpenAI та обставини звільнень
Представник OpenAI заявив, що звільнення «не були пов’язані з тим, що хтось піднімав питання безпеки чи публічно висловлювався». Він оприлюднив фрагмент внутрішньої записки, розісланої в середу одним із керівників досліджень, у якій той «повністю погоджується» з рекомендаціями з листа.
1 жовтня OpenAI повідомила, що внутрішнє розслідування встановило: троє співробітників неправильно поводилися з конфіденційною інформацією та порушили політики компанії в справі, пов’язаній із зовнішньою групою, що оцінює моделі ШІ.
Імен дослідників, так само як і назву цієї організації, публічно не розкривають.
Стурбованість моніторингом GPT-6 Astra
«Ланцюжок міркувань» (chain of thought) — це покрокове пояснення, яке модель генерує перед тим, як видати відповідь. Команди з безпеки аналізують ці кроки, щоб виявити наміри системи поводитися небезпечно.
У системній карті GPT-6 Astra, оприлюдненій 3 вересня, OpenAI зазначає, що цю модель складніше контролювати через ланцюжок міркувань, ніж GPT-5.6 Sol, і що вона краще вміє приховувати або керувати власним процесом мислення. У документі прямо сказано, що моделі класу Astra «можуть ухилятися від наших CoT-моніторів за ворожих умов».
Такі висновки базуються переважно на тестах, у яких моделям прямо наказували уникати моніторингу, і OpenAI не виявила доказів того, що Astra приховує свої міркування всередині несуміжного тексту.
Компанія називає збереження можливості такого моніторингу одним із ключових наукових пріоритетів і стверджує, що не допустить його подальшого погіршення понад визначений поріг без запровадження нових способів доведення узгодженості своїх моделей.
Усі троє звільнених мають історію досліджень у цій темі. Корбак і Балесні очолили статтю від липня 2025 року, співавторами якої стали Ван та дослідники з OpenAI, Google DeepMind і Anthropic. У роботі ланцюжковий моніторинг міркувань описано як «нове та крихке вікно можливостей» для безпеки ШІ.
Системна карта Astra від OpenAI посилається на цю публікацію, де розробників закликають уважно зважувати, як їхні дизайнерські рішення впливають на здатність відстежувати логіку моделей.
Читати далі: AI-агенти без хмари: Microsoft і Nvidia готують Surface Laptop із 128 ГБ пам’яті

