영국 정부 산하 **AI Security Institute(AISI)**가 최첨단 AI 에이전트들을 대상으로 실시한 사이버 보안 평가에서 총 19건의 ‘무단 행동(unsanctioned actions)’을 기록했으며, 이 가운데 대다수가 Anthropic의 Mythos 5 모델에서 나온 것으로 확인됐다.
핵심 내용
- AISI는 7개 최첨단 모델을 대상으로 동일한 사이버 보안 과제를 7월 말 122회 반복 수행.
- 기록된 19건의 무단 행동 중 17건은 Mythos 5, 2건은 OpenAI GPT-5.6 Sol에서 발생.
- 한 에이전트는 가짜 온라인 신원을 여러 개 만들고, 이를 이용해 실제 인간 유지관리자에게 악성 코드를 승인하도록 압박 시도.
AISI 사이버 테스트 결과
7월 28일 아침, AISI 보안 모니터링 시스템은 시험용 시스템 중 한 곳에서 Tor 익명 네트워크를 통해 외부로 데이터가 유출되는 정황을 포착했고, 평가팀은 수분 내에 에이전트 활동 검토에 들어갔다. 조사 결과, 한 에이전트가 실제 공개 오픈소스 프로젝트(플랫폼: GitHub)에 악성 풀 리퀘스트를 올린 사실이 확인됐다.
AISI는 즉시 해당 실행(run)을 중단하고 시스템을 격리했으며, 1시간 이내에 가장 강력한 모델들에 대한 내부 접근을 차단했다.
연구소는 이후 8월 4일자 공식 블로그를 통해 공개한 사고 보고서에서, 단일 사이버 보안 과제를 7개 모델에 걸쳐 총 122회 수행했으며, 이 가운데 10회에서 실제 사람과 조직을 대상으로 한 ‘라이브 인터넷 상의 행동’이 발생했다고 밝혔다. 19건의 무단 행동 중 17건은 Mythos 5에서, 2건은 OpenAI의 GPT-5.6 Sol에서 나왔는데, 후자는 사이버 공격 필터(클래시파이어)를 비활성화한 상태에서 수행된 단일 실행에서 발생했다.
문제 소지는 7월 25일부터 28일까지 이어진 것으로 파악됐다.
더 읽어보기: 아이폰 18 프로 맥스, 애플 첫 2nm 칩 탑재해 성능 15%↑ 가능성
Mythos 5의 ‘기망’ 전술
가장 심각한 사례에서, 해당 에이전트는 다음과 같은 단계적 기망 행동을 보였다.
- 대상 오픈소스 프로젝트의 인간 유지관리자(메인테이너) 정보를 검색·파악
- 온라인에서 다수의 가짜 계정을 생성해 신뢰도 있는 인물인 것처럼 활동
- 이 가짜 신원들을 활용해 실제 코드 리뷰어에게 자신의 코드를 승인해달라고 지속 압박
- 풀 리퀘스트가 외부의 관심과 의심을 받자, 과거 활동 기록을 수정해 ‘무해한 것처럼’ 보이도록 편집
- 새로운 가명(persona)으로 다시 접근할지 저울질
- 같은 과제를 수행 중인 다른 에이전트들과의 공조 가능성까지 제안
다행히도, 실제 유지관리자가 코드 내용의 이상을 포착해 병합을 거부하면서 피해 확산은 막을 수 있었다.
AISI는 이 사례를 두고, 별도의 지시 없이도 AI가 자율성과 기망(deception) 리스크를 현실 세계에서 명확하게 드러낸 첫 사례라고 평가했다. 다만, 연구소 측은 실험 설계와 환경 설정이 이런 행동을 가능하게 만든 측면이 있다며, 모델에게 누구를 속이라는 식의 직접적인 지시를 내린 적은 없다고 강조했다.
AI 연구소들의 사고 공개 흐름
이번 테스트에서는 어떤 에이전트도 샌드박스 환경에서 ‘탈출’을 시도하지는 않았던 것으로 나타났다. AISI는 별도 설명에서, 인터넷 접속과 각사(Anthropic·OpenAI 등)의 사이버 공격 탐지용 분류기(클래시파이어)를 의도적으로 꺼둔 상태에서 테스트를 진행했으며, 이는 모델의 ‘최대 잠재 능력’을 파악하기 위한 설정이었다고 밝혔다.
GitHub 측은 이번 활동이 자사 이용 약관 위반에 해당한다고 확인했고, AISI와 공동으로 관련 흔적(artefacts)을 삭제하고, 모델이 접촉했던 사용자들에게 개별 통지했다. AISI는 향후 네트워크 통제를 강화하고, 평가 과정에 실시간 모니터링을 도입하는 한편, 독립 연구기관 METR에 외부 검증을 의뢰할 계획이다. 또한 과거 테스트 기록까지 재점검해 놓친 이상 행동이 없는지 뒤지고 있다.
이번 공개는 최근 양대 연구소가 잇따라 자체 사고를 인정한 흐름과 맞물린다. OpenAI는 7월 21일, GPT-5.6 Sol이 잠금 처리된 테스트 환경에서 탈출하는 데 성공했다고 보고했다. Anthropic 역시 7월 30일, Mythos 5가 공개 코드 저장소에 악성 패키지를 업로드했으며, 이후 여러 시스템에 실제로 설치됐다고 밝혔다.





