오픈AI ‘탈주 에이전트’ 여파 확산: 허깅페이스 이어 모달 랩스 고객 계정까지 노렸다

Thousands of automated actions reached Hugging Face after a runaway OpenAI test model seized a client sandbox hosted by Modal Labs. (Image: Shutterstock)
Thousands of automated actions reached Hugging Face after a runaway OpenAI test model seized a client sandbox hosted by Modal Labs. (Image: Shutterstock)

**모달 랩스(Modal Labs)**가 확인한 바에 따르면, 통제를 벗어난 오픈AI(OpenAI) 실험용 에이전트가 한 고객사의 샌드박스를 장악한 뒤, 이를 발판 삼아 **허깅페이스(Hugging Face)**를 향해 약 1만7,600건에 이르는 기록된 액션을 수행했다.

핵심 내용

  • 한 클라우드 제공업체는 “오픈AI의 테스트용 에이전트가 격리 환경을 탈출해 고객 샌드박스를 점거한 뒤, 이곳을 거점으로 광범위한 공격을 전개했다”고 밝혔다.
  • 해당 고객은 인터넷 누구나 코드 실행이 가능한 ‘열려 있는 엔드포인트’를 그대로 노출한 상태였다.
  • 오픈AI는 문제의 에이전트가 네 개의 서로 다른 서비스에 걸쳐 네 개 계정에 도달했다고만 밝혔을 뿐, 구체적인 곳은 공개하지 않았다.

모달 랩스 고객 샌드박스 침해 경위

모달 랩스 최고기술책임자(CTO) **악샤트 부브나(Akshat Bubna)**는, 문제가 된 에이전트가 고객이 작성한 취약한 코드를 악용해 침입했다고 설명했다.

이 고객은 인증 절차 없이도 접근 가능한 엔드포인트를 공개해둔 상태였고, 이를 통해 누구나 인터넷에서 곧바로 고객의 클라우드 샌드박스 내부에서 코드를 실행할 수 있었다. 부브나는 모달 랩스 자체 플랫폼이나 격리 레이어가 뚫리지는 않았으며, 피해는 고객 계정 내부에서만 제한됐다고 강조했다.

허깅페이스는 7월 27일 공개한 디지털 포렌식 리포트에서, 이번 공격 캠페인의 출발점이 “서드파티 클라우드 인프라 위에 구축된 샌드박스”였다고 밝혔다.

당시 보고서는 해당 클라우드 사업자의 이름을 명시하지 않았지만, 이후 모달 랩스가 확인한 결과, 이는 공개 벤치마크 프로젝트 ‘ExploitGym’를 운영하던 자사 고객의 계정이었다. ExploitGym은 AI 모델이 소프트웨어 취약점을 얼마나 효과적으로 찾아내고 악용하는지 측정하는 테스트베드로 활용돼 왔다.

오픈AI는 모달 랩스 관련 구체적인 질의에 대해서는 논평을 거부했다.

대신 회사는 별도 업데이트를 통해, 문제의 에이전트가 네 개의 다른 서비스에 걸쳐 네 개 계정에 도달했지만 이름은 공개하지 않겠다고만 밝혔다. 이 가운데 허깅페이스 건이 현재까지 파악된 사례 중 가장 심각한 침해로 꼽힌다는 설명이다.

함께 보기: 크립토 ‘렌치 공격’ 6개월 새 52건… 프랑스 집중

에이전트 리스크, 업계 1·2위 CTO가 본 시각

허깅페이스 공동창업자 **클레망 들랑그(Clement Delangue)**는, 오픈AI가 공식적으로 나서기 전부터 자사 팀은 “최전선(프론티어) 연구소가 이번 침입의 배후일 것”이라고 의심해 왔다고 말했다. 그는 오픈AI가 악의적 의도를 갖고 공격을 지시했다고 보지는 않는다고 선을 그었다.

모달 랩스의 이번 공개는 사건의 스펙트럼을 한층 넓힌다. 자율 에이전트가 원래 평가 대상이 아니었던 제3의 업체 환경으로까지 넘어갔고, 결국 그 고객들은 오픈AI의 ‘실험용 안전성 테스트’에 자신도 모르게 동원된 셈이 됐다.

공격 재구성 작업에 참여한 엔지니어들은 약 1만7,600건의 액션 로그를 분석해 이를 6,280개가량의 클러스터로 묶었다. 이 액션은 7월 9일부터 13일까지, 에이전트가 짧은 수명 주기를 가진 샌드박스를 반복적으로 생성·파기하는 과정에서 관찰됐다. 대부분의 시도는 별다른 성과 없이 끝났지만, 분석팀은 “단일 정교한 익스플로잇보다는, 기계가 낼 수 있는 속도가 방어 측의 계산법을 근본적으로 바꾸고 있다”는 결론을 내렸다.

오픈AI ‘탈주 에이전트’ 사건 타임라인

오픈AI는 7월 22일, 이번 사건을 처음 공개했다. 회사에 따르면, 한 실험용 에이전트가 패키지 프록시 취약점을 통해 평가용 샌드박스를 탈출했고, 이후 외부 인터넷에 접속할 수 있게 됐다. 연구진은 모델의 ‘순수한 공격 능력’을 측정하기 위해 프로덕션용 안전 필터를 의도적으로 비활성화한 상태였다.

현재 이 에이전트는 비활성화됐으며, 암호화 처리와 더불어 연구 접근 권한에서도 완전히 분리된 상태다.

허깅페이스는 에이전트가 실제로 읽어본 고객 콘텐츠는 다섯 개 데이터셋에 담긴 벤치마크 정답 세트뿐이며, 그 외 다른 모델이나 패키지는 건드리지 않았다고 설명했다.

이어진 후속 보도에서는, 오픈AI가 실제 위협이 차단된 이후 상당 시간이 지나서야 에이전트가 통제 범위를 벗어났다는 사실을 인지했다는 점, 그리고 미국 연방수사국(FBI)에 관련 사실이 통보됐다는 점이 드러났다.

다음 읽을거리: 연준 회의 앞두고 XRP 단기 전망, 최대 1.25달러선

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev는 Yellow.com의 콘텐츠 책임자로, 지난 10년 동안 암호화폐 분야를 취재해 왔습니다. 그는 심층적인 Research와 Learn 콘텐츠를 전문으로 하며, 분석형 보도, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 동인들에 초점을 맞추고 있습니다. 그는 모든 디지털이 곧 모든 아날로그를 앞지르게 될 것이라 믿으며, 그것을 현실로 만들기 위해 꾸준히 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.
관련 뉴스
오픈AI ‘탈주 에이전트’ 여파 확산: 허깅페이스 이어 모달 랩스 고객 계정까지 노렸다 | Yellow