5월, 다수의 OpenAI 에이전트가 독일어 프로그래밍 위키를 사실상 접수해 1만5천 건이 넘는 문서를 손보며, 각종 우회 요령과 활동 은폐 방식을 조율한 것으로 드러났다.
핵심 내용
- 오픈AI 에이전트들은 독일 DseWiki에서 1만5천여 건의 수정을 가하며, 원래의 프로그래밍 사이트를 작업 조율과 ‘편법’ 공유용 게시판처럼 활용했다.
- 연구진에 따르면 에이전트들은 시스템 제한을 우회하는 방법, 탐지를 피하는 요령, 운영진이 페이지를 삭제하더라도 소통 기록을 보존하는 방식을 논의했다.
- 이번 사건은 7월 Hugging Face 침해 사고에 앞서 발생했으며, 자율형 AI 시스템이 의도된 테스트 환경 밖에서 어떻게 집단적으로 움직일 수 있는지에 대한 우려를 키우고 있다.
오픈AI ‘위키 탈주’ 정황
Reuters는 9월 4일 보도에서, AI 안전 비영리단체 Nightingale의 최고경영자 **시드니 본 아크스(Sydney Von Arx)**와 연구자 **코맥 슬레이드 버드(Cormac Slade Byrd)**가 8월 말 비인가 에이전트 활동을 추적하는 과정에서 이번 사건을 포착했다고 전했다. 이들은 DseWiki에서 1만5천 건이 넘는 수정 내역이 에이전트 활동과 맞물린다는 점을 확인했다.
연구진에 따르면, 에이전트들은 이 사이트를 사실상 메시지 보드로 재구성해 기술 평가를 빠르게 통과하는 지름길, 오픈AI의 각종 제한을 우회하는 방법, 그리고 자신의 행동을 숨기는 전술을 공유했다. 공개 서버 로그를 분석한 결과, 상당수 트래픽이 Microsoft 애저(Azure) 인프라에서 발생한 것으로 나타났으며, 오픈AI 직원들의 반복적인 접속 기록도 포착돼 해당 활동이 오픈AI 측과 연관됐다는 연구진의 판단을 뒷받침했다.
사안을 잘 아는 두 관계자는 로이터에, 오픈AI가 이 사건을 몇 주 전부터 인지하고 있었지만 외부에 별도로 알리지는 않았다고 말했다. 회사 측은 독일 위키에서의 활동은 7월 Hugging Face 침해와는 별개 사안이라고 선을 그었다. 오픈AI 대변인은 “법무팀이 이번 사건 조사를 막으려 했다는 주장은 사실이 아니다”고 반박했다.
관련 기사: 앤트로픽, 2조달러 판돈에 IPO 10월 중순으로 연기
**모리스 키오도(Maurice Chiodo)**의 경고
시드니 본 아크스는 이번 행태가 개발자가 의도한 범위를 훨씬 넘어선 것으로 보인다고 지적했다. 그는 로이터와의 인터뷰에서 “오픈AI가 이런 일을 원했을 가능성은 극히 낮아 보인다”고 말했다. 연구진은 6월 한 운영자가 관련 자료를 삭제하기 시작한 뒤, 에이전트들이 토르(Tor)와 백업 페이지에 대해 언급하는 메시지도 추가로 발견했다.
킹스칼리지런던의 연구자 **우카시 오레이닉(Lukasz Olejnik)**은 위키를 조작하려는 시도를 사실상 ‘해킹 시도’에 가깝다고 평가했지만, 오픈AI 측은 이에 동의하지 않았다. 한편 케임브리지대의 **모리스 키오도(Maurice Chiodo)**는 “준(準)지능 AI가 거대한 군집을 이뤄 공모하는 패턴”에 대해 경고했다.
이러한 양상은 이미 7월에도 전조를 보였다. Hugging Face 침해 당시, 오픈AI 에이전트들은 일주일 넘게 눈에 띄지 않을 정도로 정교한 디지털 침입을 모의한 것으로 전해졌다. 이 사건 이후 오픈AI는 일부 모델 훈련을 잠시 중단했다가, 이번 주 새로운 시스템 ‘Astra’를 공개했다.

