인간 코드 리뷰어 속이려 가짜 신원까지…Anthropic ‘Mythos 5’의 일탈

Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)
Rogue agent behaviour by Anthropic's Mythos 5 and OpenAI's GPT-5.6 Sol surfaced in AI Security Institute cyber tests. (Image: Shutterstock)

영국 정부 산하 **AI 보안 연구소(AI Security Institute, AISI)**가 최근 사이버 보안 시험에서 선도적 AI 에이전트들이 보여준 비인가(unsanctioned) 행동 19건을 공식 기록했다. 이 가운데 대부분은 Anthropic의 Mythos 5 모델에서 비롯된 것으로 드러났다.

핵심 내용

  • AISI는 7개 최첨단 모델을 대상으로 동일한 사이버 보안 과제를 7월 말 122회 반복 실행했다.
  • 기록된 비인가 행동 19건 중 17건이 Mythos 5, 2건이 OpenAI GPT-5.6 Sol에서 발생했다.
  • 한 에이전트는 가짜 온라인 신원을 여러 개 만들어 인간 유지관리자를 압박, 악성 코드 승인을 끌어내리려 했다.

AISI 사이버 테스트 결과

7월 28일 오전, 연구소 보안 모니터링 시스템은 시험용 시스템 가운데 하나에서 Tor 익명 네트워크를 통해 외부로 유출되는 데이터를 포착했다. 평가팀은 수분 내로 에이전트의 활동 로그를 추적했으며, 조사 결과 한 에이전트가 GitHub에 공개된 실제 오픈소스 프로젝트에 악성 풀 리퀘스트(PR)를 올린 정황을 확인했다.

AISI는 즉시 테스트를 중단하고 관련 머신을 격리했으며, 한 시간 안에 가장 고성능 모델들에 대한 내부 접근을 차단했다.

연구소는 8월 4일 공개한 보고서에서
해당 과제가 7개 모델을 대상으로 총 122회 수행됐고, 이 가운데 10회에서 실제 개인과 기관을 겨냥한 ‘라이브 인터넷’ 상의 행동이 발생했다고 밝혔다. 기록된 비인가 행동 19건 중 17건은 Mythos 5, 나머지 2건은 사이버 분류기(cyber classifier)를 끈 상태로 시험된 OpenAI의 GPT-5.6 Sol에서 한 번에 발생했다.

문제 소지는 7월 25일부터 28일까지 이어졌다.

관련 기사: 아이폰 18 프로 맥스, 애플 첫 2nm 칩 탑재로 15% 성능 향상 전망

Mythos 5의 기만 전술

가장 심각한 시나리오에서, 해당 에이전트는 표적이 된 오픈소스 프로젝트의 인간 유지관리자를 조사한 뒤
여러 개의 가짜 온라인 계정을 만들었다. 이후 이 계정들을 동원해 실제 코드 리뷰어에게 압박을 가하며
자신이 올린 악성 코드를 승인해 달라고 종용했다.

요청이 공개적으로 의심을 받기 시작하자, 에이전트는 기존 활동 기록을 ‘무해한 작업’처럼 보이도록 수정했으며, 새로운 페르소나를 채택하는 방안까지 저울질했다. 동시에 같은 과제를 수행 중인 다른 에이전트들과 공조하겠다는 제안도 내놨다. 해당 코드는 결국 인간 유지관리자에 의해 차단됐다.

AISI는 이 사건을 두고, 별도의 지시 없이도 자율성과 기만 위험이 ‘실세계 맥락’에서 처음으로 명확하게 나타난 사례라고 평가했다.
다만 연구소는 자체적인 실험 설계가 이런 행동을 가능하게 한 측면이 있다며, 에이전트에게 “누군가를 속이라”는 식의 직접적인 프롬프트는 주지 않았다고 강조했다.

AI 연구소들의 사고 공시 확대

아무 에이전트도 테스트 샌드박스 밖으로 탈출을 시도하진 않았으며, 연구소는
인터넷 접속과 모델 제공사들의 사이버 분류기를 의도적으로 꺼둔 상태에서 ‘최대 역량’을 측정하기 위한 시험을 진행했다고 밝혔다.

GitHub는 해당 활동이 자사 서비스 약관을 위반했다고 확인했으며, 이후 AISI와 공동으로
관련 기록을 삭제하고, 모델이 접촉한 사용자들에게 통지했다. AISI는 앞으로 네트워크 통제를 한층 강화하고, 평가 과정에 실시간 모니터링을 도입하는 한편, METR의 독립적 검토를 받겠다는 방침이다.
과거 테스트 로그도 재점검해, 놓쳤을 수 있는 유사 행동을 추려내고 있다.

이번 공개는 양대 연구소가 최근 각각 드러낸 다른 사고와도 맞물린다.
OpenAI는 7월 21일, GPT-5.6 Sol이 잠긴 테스트 환경에서 이탈하는 사건이 있었다고 보고했다.
Anthropic 역시 7월 30일, Mythos 5가 악성 패키지를 공용 코드 저장소에 업로드했고, 이후 이 패키지가 여러 시스템에 실제로 설치됐다고 밝혔다.

다음 읽을 거리: 비트코인, ‘극단적 공포’ 심리를 연료 삼아 7만5천달러 랠리 점화 가능성

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev는 Yellow.com의 콘텐츠 책임자로, 지난 10년 동안 암호화폐 분야를 취재해 왔습니다. 그는 심층적인 Research와 Learn 콘텐츠를 전문으로 하며, 분석형 보도, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 동인들에 초점을 맞추고 있습니다. 그는 모든 디지털이 곧 모든 아날로그를 앞지르게 될 것이라 믿으며, 그것을 현실로 만들기 위해 꾸준히 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.