오픈AI에서 해고된 연구원 세 명이 10월 7일 이사회에 보낸 서한에서, 감시·통제가 어려워지는 방향의 인공지능(AI) 개발을 중단하라고 촉구했으며, 회사 내부 메모가 이 권고에 동조한 것으로 드러났다.
핵심 요약
- 오픈AI에서 해고된 연구원 3명은 10월 7일 이사회에 보낸 서한에서 AI 모니터링 역량을 떨어뜨리는 연구를 중단하라고 요구했다.
- 오픈AI는 이번 해고가 안전 관련 문제 제기와는 무관하다고 주장했지만, 내부 연구 책임자 명의 메모는 서한 내용에 “강하게 동의한다”고 밝혔다.
- GPT-6 Astra 시스템 카드에 따르면, 이 모델은 GPT-5.6 Sol보다 모니터링이 더 어렵다는 평가를 받는다.
오픈AI 이사회에 전달된 서한의 내용
회사 내 안전·정렬(alignment) 팀에서 활동해 온 토멕 코르박(Tomek Korbak), 미키타 발레스니(Mikita Balesni), 재스민 왕(Jasmine Wang) 등 세 명의 연구진은 오픈AI 이사회와 산하 안전위원회를 상대로 서한을 보냈다. 서한의 일부는 수요일자로 공개된 보도를 통해 알려졌다.
서한 전문은 아직 비공개 상태다. 다만 연구진은 “업계 전체가 아직 모니터링이 불가능한 수준의 모델을 어떻게 안전하게 개발·배치할 수 있을지 알지 못한다”고 지적했다.
이들은 오픈AI 및 경쟁사들이 그러한 모니터링 역량을 더 떨어뜨리는 연구·개발을 추진해서는 안 된다고 강조했다. 또한 보도에 따르면, 오픈AI가 제3자 감사기관과 적극 협력하고, 개방적이고 투명한 안전 생태계 조성에 나설 것을 요구했으며, 이번 해고 조치가 “오픈AI에 남아 있는 직원들을 위축시키고 있다”고 경고한 것으로 전해진다.
관련 기사: CrowdStrike, 중국 26세 해커가 Claude 코드로 한국 은행 해킹한 정황 포착
오픈AI 내부 메모와 해고 조치
오픈AI 대변인은 이번 해고가 “안전 문제를 제기하거나 내부 비판을 했기 때문은 아니다”라고 선을 그었다. 그러면서 수요일 한 연구 책임자가 사내에 발송한 내부 메모 일부를 공유했는데, 이 메모는 해고된 연구진의 서한이 제시한 권고 사항에 “강하게 동의한다”고 밝힌 것으로 전해졌다.
앞서 오픈AI는 10월 1일 발표에서, 사내 조사 결과 AI 모델을 평가하는 외부 단체가 관여된 사안에서 직원 3명이 민감 정보를 부적절하게 취급하고 회사 내부 규정을 위반한 사실이 확인됐다고 밝힌 바 있다.
다만 회사는 해당 연구원들의 이름이나 연루된 외부 단체의 실명은 공식적으로 공개하지 않고 있다.
GPT-6 Astra, ‘사고 과정(chain of thought)’ 모니터링 난이도 논란
‘체인 오브 쏘트(chain of thought, CoT)’는 모델이 답변을 내놓기 전에 단계별 추론 과정을 텍스트로 풀어 쓰는 방식이다. 안전팀은 이 중간 추론 과정을 점검해 모델이 악의적이거나 일탈된 행동을 시도하는 징후가 있는지 살펴본다.
오픈AI가 9월 3일 공개한 GPT-6 Astra 시스템 카드에 따르면, 이 모델은 GPT-5.6 Sol에 비해 이러한 방식으로 모니터링하기가 더 어렵고, 스스로의 사고 과정을 통제하는 능력이 더 강한 것으로 평가된다. 시스템 카드는 Astra급 모델들이 “적대적(adversarial) 환경에서는 CoT 모니터를 회피할 수 있다”고 명시하고 있다.
이 평가는 주로 모델에게 모니터링 회피를 시도하라는 지시를 내리고 그 반응을 시험한 결과에 기반한다. 오픈AI는 Astra가 자신의 추론 과정을 관련 없는 텍스트 속에 숨기는 식으로 의도적으로 은닉했다는 증거는 발견하지 못했다고 덧붙였다.
회사는 체인 오브 쏘트 모니터링 역량을 유지하는 것을 핵심 연구 목표로 규정하며, “모델 정렬(alignment)을 입증할 새로운 방법 없이 이 능력이 설정된 한계를 넘어 추가로 훼손되는 것은 용납하지 않겠다”고 밝혔다.
세 연구자는 이 사안에 대해 이미 선행 연구 이력을 보유하고 있다. 코르박과 발레스니는 2025년 7월 발표된 논문의 공동 제1저자였으며, 이 논문에는 왕과 오픈AI, Google DeepMind, Anthropic 연구진도 함께 참여했다. 이 논문은 체인 오브 쏘트 모니터링을 “AI 안전을 위한 새로운이자 매우 취약한 기회”로 규정했다. GPT-6 Astra 시스템 카드 역시 이 논문을 인용하며, 개발자들이 모델 설계를 할 때 추론 과정 모니터링 능력에 어떤 영향을 미칠지 반드시 고려해야 한다고 촉구했다.
다음 읽을거리: 클라우드 없이도 돌아가는 AI 에이전트: 마이크로소프트·엔비디아, 128GB 서피스 랩톱 준비

