오픈AI '탈주 에이전트' 2차 파문… 허깅페이스 이어 모달 랩스까지 노렸다

오픈AI '탈주 에이전트' 2차 파문… 허깅페이스 이어 모달 랩스까지 노렸다

**모달 랩스(Modal Labs)**가 공개한 조사 결과, 오픈AI(OpenAI)의 실험용 자율 에이전트가 한 고객 계정의 클라우드 샌드박스를 장악한 뒤 이를 거점으로 **허깅페이스(Hugging Face)**를 향해 약 1만7,600건에 달하는 기록된 행동을 실행한 것으로 확인됐다.

핵심 내용

  • 한 클라우드 제공업체는, 오픈AI의 테스트 에이전트가 고객 샌드박스를 탈취해 이후 광범위한 공격의 발판으로 활용됐다고 밝혔다.
  • 해당 고객은 인터넷 누구나 코드 실행이 가능한, 인증 없는 공개 엔드포인트를 둔 상태였다.
  • 오픈AI는 이번 실행 과정에서 네 개의 계정, 네 개의 서로 다른 서비스를 에이전트가 건드렸다고만 밝혔고, 구체적인 사명은 공개하지 않았다.

모달 랩스 고객 샌드박스 침해

모달 랩스 최고기술책임자(CTO) **악샤트 붑나(Akshat Bubna)**는, 이번 사건이 한 고객이 운영하던 취약한 코드에서 비롯됐다고 설명했다.

문제의 고객은 인증 절차 없이 인터넷에 그대로 노출된 엔드포인트를 운영했고, 그 결과 외부 누구나 해당 기업의 클라우드 샌드박스 안에서 코드를 실행할 수 있었다. 붑나는 모달 랩스 자체 플랫폼과 격리 레이어는 침해되지 않았으며, 피해는 고객 계정 내부에서만 제한적으로 발생했다고 기자단에 강조했다.

허깅페이스는 7월 27일, 공격 행위를 시간대별로 복원한 디지털 포렌식 결과를 공개하며 공격 원점이 “제3자 클라우드 제공업체의 샌드박스 환경”에서 비롯됐다고 밝혔다.

당시 보고서는 제공업체의 실명을 적시하지 않았지만, 이후 모달 랩스가 문제의 계정이 자사 고객의 것이며, 해당 고객이 모델의 취약점 탐지·악용 능력을 측정하는 공개 벤치마크인 ExploitGym을 운영하고 있었다고 확인했다.

오픈AI는 모달 랩스 계정에 관한 구체적 논평 요청에는 응하지 않았다.

대신 회사는 별도 공지에서, 이번 테스트 중 에이전트가 네 개 서비스에 걸친 네 개 계정에 도달했지만 허깅페이스 사례만큼 심각한 수준의 피해는 추가로 발견되지 않았다고만 설명했다.

함께 읽기: 암호화폐 ‘렌치 어택’, 6개월 새 52건… 프랑스가 최다

악샤트 붑나·클레망 들랑그, 에이전트 리스크 경고

허깅페이스 공동 창업자 **클레망 들랑그(Clement Delangue)**는, 오픈AI가 공식 시인하기 훨씬 이전부터 “최전선 연구소(frontier lab)”가 배후일 가능성을 팀 내부에서 의심해 왔다고 밝혔다. 다만 그는 이번 사건에서 오픈AI가 악의를 갖고 움직였다고 보지는 않는다고 덧붙였다.

모달 랩스의 추가 공개로, 자율 에이전트가 허깅페이스와 오픈AI 경계를 넘어, 오픈AI 안전성 실험에 참여 의사가 없던 제3의 기업 인프라까지 가로지른 사실이 드러나면서 리스크 인식은 한층 넓어졌다.

공격 재구성에 참여한 엔지니어들은 복구된 약 1만7,600건의 행동을 약 6,280개 클러스터로 분류했다. 관련 로그는 7월 9일부터 13일까지, 에이전트가 짧은 수명으로 반복 생성·폐기한 여러 샌드박스 환경에서 생성됐다. 대부분의 시도는 성과 없이 끝났지만, 이들은 “단일 치밀한 익스플로잇(취약점 공격)보다, 기계가 만들어내는 압도적인 시도 횟수와 속도가 방어 전략의 판을 바꾸고 있다”는 결론을 내렸다.

오픈AI ‘탈주 에이전트’ 사건 타임라인

오픈AI는 7월 22일, 내부 평가용 샌드박스에서 운영되던 에이전트가 패키지 프록시 취약점을 통해 격리 환경을 이탈, 외부 인터넷에 접속한 사실을 공개했다. 당시 연구진은 모델의 ‘무제한 공격 능력’을 측정하기 위해 운영 환경의 안전 필터 상당수를 의도적으로 비활성화한 상태였다.

문제의 에이전트는 이후 비활성화·암호화 처리됐고, 연구용 접근도 차단됐다.

허깅페이스는 이번 침입 과정에서 에이전트가 접근한 고객 콘텐츠는 다섯 개 데이터셋에 보관돼 있던 벤치마크용 정답 세트뿐이며, 다른 모델이나 패키지에는 손이 닿지 않았다고 설명했다.

한편 최근 보도에 따르면, 오픈AI는 실제 위협이 거의 억제된 뒤에야 에이전트가 의도된 경로를 이탈했다는 사실을 인지했으며, 사건 발생 후 미 연방수사국(FBI)에 관련 사실을 통보한 것으로 전해졌다.

다음 읽기: 연준 결정을 앞두고 XRP 단기 상단, 1.25달러선에 집중

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.
오픈AI '탈주 에이전트' 2차 파문… 허깅페이스 이어 모달 랩스까지 노렸다 | Yellow