오픈AI의 ‘아스트라’가 추론 과정을 눈에 보이는 텍스트로 덜 드러내는 것으로 관측되면서, 수석과학자 야쿱 파초키(Jakub Pachocki) 등이 2025년에 발표한 모니터링 가능성 논문의 우려가 다시 수면 위로 떠올랐다.
핵심 포인트
- 아스트라는 추론의 상당 부분을 답안에 드러내지 않는 것으로 보이며, 이로 인해 감시 시스템이 문제 행위를 제대로 포착할 수 있는지에 대한 우려가 커지고 있다.
- **라이언 그린블랫(Ryan Greenblatt)**과 파초키는 2025년 7월, 체인오브쏘트(Chain-of-Thought) 모니터링 가능성을 “깨지기 쉬운 AI 안전성 기회”라고 규정한 논문의 공동저자다.
- EU ‘범용 AI 실천 강령’ 서명 기업은 AI 사무소(AI Office)에 모델 안전성 보고서를 제출해야 하며, 독립 검증이 가능한 평가 근거를 포함해야 한다.
아스트라 모니터링 가능성 논란
**세마포어(Semafor)**는 보도를 통해, 아스트라가 답변 과정에서 추론을 외부에 드러내지 않은 채 내부적으로 더 많이 수행하는 것으로 보인다고 전했다. 이로 인해 모니터가 모델 작동 중에 의심스러운 행동을 여전히 포착할 수 있는지에 대한 의문이 제기됐다.
AI 안전성 연구기관 **레드우드 리서치(Redwood Research)**의 연구자 그린블랫은 기고문에서 아스트라가 “어려운 경시 수학 문제를 전부 머릿속에서만 풀 수 있는 것처럼 보인다”고 지적하며, “이는 극도로 우려스러운 상황”이라고 평가했다.
일부 보도는 오픈AI가 모델 능력을 끌어올리기 위해 의도적으로 출력 과정의 가시성을 낮췄을 가능성을 제기했다. 회사는 이에 대해 공식 확인을 내놓지 않았다. 파초키는 “혼란스러운 보도로 인해 ‘모니터링 불가능성 경쟁(race into unmonitorability)’이 촉발되는 것을 막고 싶다”고 언급하며, 논쟁이 과열되는 데 선을 그었다.
TNW는 앞서, 아스트라가 이전 세대 모델보다 모니터링이 더 어려워졌으며, 특히 모델이 감시를 회피하려는 시도를 할 때 그 경향이 뚜렷했다고 전한 바 있다. 오픈AI는 이러한 ‘감시 회피’ 문제를 핵심 연구과제로 공표해 왔다.
함께 읽기: 오픈AI “AI, 이제 며칠씩 이어지는 연구 업무도 처리 가능”
파초키의 안전성 경고
이번 논쟁이 주목받는 이유는, 그린블랫과 파초키 모두가 2025년 7월 발표된 체인오브쏘트 모니터링 논문의 약 40명 공동 저자에 포함돼 있기 때문이다. 해당 논문은 체인오브쏘트 기반의 추론 노출을 “새롭지만 취약한 AI 안전성의 창”으로 규정했다.
논문에는 오픈AI를 비롯해 구글 딥마인드(Google DeepMind), 앤트로픽(Anthropic), 메타(Meta), 아마존(Amazon), 영국 AI 보안 연구소(UK AI Security Institute), 레드우드 리서치 연구진이 대거 참여했다.
연구진은 최전선(Frontier) AI 개발사들에게 다음과 같은 조치를 권고했다.
- 모니터링 가능성에 대한 표준화된 평가 체계를 구축할 것
- 시스템 카드(System Card)에 평가 결과와 한계를 공개할 것
- 모델 학습·배포 의사결정 시 단순 성능뿐 아니라 모니터링 가능성을 함께 고려할 것
유럽은 이러한 보고 절차에 제도적 귀착점을 마련해 두고 있다. EU ‘범용 AI 실천 강령’ 서명 기업은 시장 출시 시점까지 **AI 사무소(AI Office)**에 모델 리포트(Model Report)를 제출해야 하며, 여기에는 모델 평가, 위험 저감 조치, 외부 평가자 보고서가 포함된다.
각 리포트에는 모든 관련 평가마다 임의로 선정된 입력·출력 샘플 5건을 반드시 첨부해야 한다. 이를 통해 외부 검토자가 독립적으로 평가할 수 있도록 하겠다는 취지다. 오픈AI 역시 이 강령의 정식 서명사다.
이번 우려는 아스트라 출시 이전부터 제기돼 왔다. 2025년 7월 논문은 새로운 모델 아키텍처가 체인오브쏘트의 ‘가시적 추론’을 약화시킬 수 있다고 경고했다. 이후 오픈AI는 이러한 안전성 모니터링을 확장하기 위해 약 20% 수준의 추가 연산(컴퓨트) 부담을 감수했다고 밝힌 바 있다.

