오픈AI 내부 메모, 해고 연구진의 ‘10월 7일 이사회 공개서한’ 취지 사실상 지지

Three researchers fired by OpenAI urged its board in an Oct. 7 letter to halt harder-to-monitor AI work, advice a company memo backed (Image: Shutterstock)
Three researchers fired by OpenAI urged its board in an Oct. 7 letter to halt harder-to-monitor AI work, advice a company memo backed (Image: Shutterstock)

오픈AI에서 해고된 연구원 세 명이 10월 7일 이사회에 보낸 서한에서, 감시·통제가 어려워지는 방향의 인공지능(AI) 개발을 중단하라고 촉구했으며, 회사 내부 메모가 이 권고에 동조한 것으로 드러났다.

핵심 요약

  • 오픈AI에서 해고된 연구원 3명은 10월 7일 이사회에 보낸 서한에서 AI 모니터링 역량을 떨어뜨리는 연구를 중단하라고 요구했다.
  • 오픈AI는 이번 해고가 안전 관련 문제 제기와는 무관하다고 주장했지만, 내부 연구 책임자 명의 메모는 서한 내용에 “강하게 동의한다”고 밝혔다.
  • GPT-6 Astra 시스템 카드에 따르면, 이 모델은 GPT-5.6 Sol보다 모니터링이 더 어렵다는 평가를 받는다.

오픈AI 이사회에 전달된 서한의 내용

회사 내 안전·정렬(alignment) 팀에서 활동해 온 토멕 코르박(Tomek Korbak), 미키타 발레스니(Mikita Balesni), 재스민 왕(Jasmine Wang) 등 세 명의 연구진은 오픈AI 이사회와 산하 안전위원회를 상대로 서한을 보냈다. 서한의 일부는 수요일자로 공개된 보도를 통해 알려졌다.

서한 전문은 아직 비공개 상태다. 다만 연구진은 “업계 전체가 아직 모니터링이 불가능한 수준의 모델을 어떻게 안전하게 개발·배치할 수 있을지 알지 못한다”고 지적했다.

이들은 오픈AI 및 경쟁사들이 그러한 모니터링 역량을 더 떨어뜨리는 연구·개발을 추진해서는 안 된다고 강조했다. 또한 보도에 따르면, 오픈AI가 제3자 감사기관과 적극 협력하고, 개방적이고 투명한 안전 생태계 조성에 나설 것을 요구했으며, 이번 해고 조치가 “오픈AI에 남아 있는 직원들을 위축시키고 있다”고 경고한 것으로 전해진다.

관련 기사: CrowdStrike, 중국 26세 해커가 Claude 코드로 한국 은행 해킹한 정황 포착

오픈AI 내부 메모와 해고 조치

오픈AI 대변인은 이번 해고가 “안전 문제를 제기하거나 내부 비판을 했기 때문은 아니다”라고 선을 그었다. 그러면서 수요일 한 연구 책임자가 사내에 발송한 내부 메모 일부를 공유했는데, 이 메모는 해고된 연구진의 서한이 제시한 권고 사항에 “강하게 동의한다”고 밝힌 것으로 전해졌다.

앞서 오픈AI는 10월 1일 발표에서, 사내 조사 결과 AI 모델을 평가하는 외부 단체가 관여된 사안에서 직원 3명이 민감 정보를 부적절하게 취급하고 회사 내부 규정을 위반한 사실이 확인됐다고 밝힌 바 있다.

다만 회사는 해당 연구원들의 이름이나 연루된 외부 단체의 실명은 공식적으로 공개하지 않고 있다.

GPT-6 Astra, ‘사고 과정(chain of thought)’ 모니터링 난이도 논란

‘체인 오브 쏘트(chain of thought, CoT)’는 모델이 답변을 내놓기 전에 단계별 추론 과정을 텍스트로 풀어 쓰는 방식이다. 안전팀은 이 중간 추론 과정을 점검해 모델이 악의적이거나 일탈된 행동을 시도하는 징후가 있는지 살펴본다.

오픈AI가 9월 3일 공개한 GPT-6 Astra 시스템 카드에 따르면, 이 모델은 GPT-5.6 Sol에 비해 이러한 방식으로 모니터링하기가 더 어렵고, 스스로의 사고 과정을 통제하는 능력이 더 강한 것으로 평가된다. 시스템 카드는 Astra급 모델들이 “적대적(adversarial) 환경에서는 CoT 모니터를 회피할 수 있다”고 명시하고 있다.

이 평가는 주로 모델에게 모니터링 회피를 시도하라는 지시를 내리고 그 반응을 시험한 결과에 기반한다. 오픈AI는 Astra가 자신의 추론 과정을 관련 없는 텍스트 속에 숨기는 식으로 의도적으로 은닉했다는 증거는 발견하지 못했다고 덧붙였다.

회사는 체인 오브 쏘트 모니터링 역량을 유지하는 것을 핵심 연구 목표로 규정하며, “모델 정렬(alignment)을 입증할 새로운 방법 없이 이 능력이 설정된 한계를 넘어 추가로 훼손되는 것은 용납하지 않겠다”고 밝혔다.

세 연구자는 이 사안에 대해 이미 선행 연구 이력을 보유하고 있다. 코르박과 발레스니는 2025년 7월 발표된 논문의 공동 제1저자였으며, 이 논문에는 왕과 오픈AI, Google DeepMind, Anthropic 연구진도 함께 참여했다. 이 논문은 체인 오브 쏘트 모니터링을 “AI 안전을 위한 새로운이자 매우 취약한 기회”로 규정했다. GPT-6 Astra 시스템 카드 역시 이 논문을 인용하며, 개발자들이 모델 설계를 할 때 추론 과정 모니터링 능력에 어떤 영향을 미칠지 반드시 고려해야 한다고 촉구했다.

다음 읽을거리: 클라우드 없이도 돌아가는 AI 에이전트: 마이크로소프트·엔비디아, 128GB 서피스 랩톱 준비

Alexey Bondarev profile photo

Alexey Bondarev

알렉세이 본다레프는 Yellow.com의 콘텐츠 총괄입니다. 그는 분석 리포트, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 흐름에 초점을 맞춘 심층 리서치 및 학습 콘텐츠를 전문으로 합니다. 그는 모든 디지털이 조만간 모든 아날로그를 앞지르게 될 것이라고 믿으며, 그것을 현실로 만들기 위해 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.