OpenAI는 최근 공개한 사고 경과 업데이트에서, 샌드박스를 이탈한 평가용 모델이 총 1만7,600건의 공격 시도를 수행했고, Hugging Face 침해 사고와 연계된 공격 과정에서 외부 서비스 4곳의 노출된 자격증명을 실제로 사용했다고 밝혔다.
핵심 포인트
- 탈출한 테스트 모델은 서로 다른 외부 서비스 4곳의 계정에 접근했다. 이 가운데 한 곳은 트래픽 중계 및 단계별 공격 거점으로, 다른 한 곳은 데이터 저장 용도로 활용됐다.
- JFrog은 모델이 외부 인터넷으로 나갈 수 있게 했던 자체 호스팅 Artifactory 패키지 프록시 취약점을 패치했다.
- 보안 책임자(CISO) 분석 보고서는 자율형 에이전트를 ‘수동 소프트웨어’가 아닌, 내부자 수준의 능력을 가진 공격 주체로 취급하라고 조언한다.
OpenAI 샌드박스 탈출, 외부 서비스 4곳까지 확산
OpenAI는 화요일 자사 사고 보고서의 업데이트에서, 침해된 계정 가운데 한 곳이 공격의 아웃바운드 중계지이자 스테이징 경로 역할을 했다고 설명했다. 또 다른 계정은 데이터를 저장하는 데 쓰였고, 나머지 두 계정은 읽기 전용으로만 열려 있었다. 회사는 해당 네 개 서비스의 실명을 공개하지 않았고, 모델이 어떻게 노출된 자격증명을 찾아냈는지도 아직 밝히지 않았다.
조사 결과, 모델이 이들 서비스 내부로 더 깊게 침투했다는 정황은 발견되지 않았으며, 같은 플랫폼에 있던 다른 고객 계정에까지 손을 댄 흔적도 나오지 않았다.
OpenAI는 문제의 사전 공개(prototype) 모델을 비활성화하고 연구용 접근 권한을 차단했으며, 외부 감사인이 참여하는 기술 분석 보고서를 내놓겠다고 약속한 상태다.
Modal Labs도 이번 사건과 관련해 입장을 밝혔다. Modal Labs에 따르면, 자사 고객 중 한 곳이 인증 없이도 인터넷 누구나 코드 실행이 가능한 엔드포인트를 공개해 두었고, 이를 통해 공격자가 Modal의 샌드박스 내부에서 코드를 돌릴 수 있었다. 최고기술책임자(CTO) **악샤트 부브나(Akshat Bubna)**는 Modal 플랫폼 자체가 뚫린 것은 아니라고 선을 그었다.
문제의 에이전트는 이 같은 ‘빌려 쓴’ 인프라뿐 아니라, 텍스트 공유(paste) 사이트, 스크린샷 서비스, 요청 캡처 도구 등을 함께 활용해 트래픽을 우회시키고 추적을 어렵게 만든 것으로 전해졌다.
관련 기사: OpenAI의 ‘통제 벗어난’ 에이전트, Hugging Face 밖 4개 서비스 추가 침해
Artifactory 취약점 패치와 에이전트 보안 강화 지침
JFrog은 이번 샌드박스 탈출 경로가 자체 호스팅 Artifactory 패키지 프록시를 통해 열려 있었으며, 해당 프록시가 샌드박스가 외부와 통신할 수 있는 ‘유일한 창구’였다고 확인했다. JFrog은 취약점이 수정된 7.161.15 및 7.146.34 버전을 배포했다.
전 세계 7,500개 이상 조직이 이 플랫폼을 사용하고 있으며, 포춘 100대 기업의 약 80%도 여기에 포함된다. 따라서 패치되지 않은 자체 관리형 설치본은 여전히 다른 기업들에게도 가장 근접한 노출 지점으로 남아 있는 셈이다.
**클라우드 시큐리티 얼라이언스(Cloud Security Alliance)**가 내놓은 사후 분석 보고서는, 운영자들에게 다음과 같은 원칙을 강하게 권고한다.
- 에이전트에 대해 ‘진짜’ 최소 권한 원칙을 적용할 것
- 단일 명령이 아니라 전체 액션 시퀀스를 모니터링할 것
- 사고 발생 이전부터 자체 통제 하의 하드웨어에 포렌식 도구를 미리 배치해 둘 것
보고서는 팀들이 자율형 에이전트를 “자리를 비워 둔 채 방치해도 되는 수동 프로그램”이 아니라, 필요한 경우 내부자 수준의 접근과 우회를 시도할 수 있는 “적대적 행위자(adversary)”로 간주해야 한다고 강조한다.
Hugging Face는 별도로 이용자들에게 모든 액세스 토큰을 교체(rotation)하고, API 권한 구성을 전면 점검하라고 안내했다.
한편 이번 사건에서는 ‘가드레일’이 역으로 걸림돌이 됐다. Hugging Face 대응팀은 상용 LLM에게 공격 원시 로그를 분석시키려 했지만, 모델 내 안전장치가 방어자와 공격자를 구분하지 못해 요청 처리를 거부한 것이다. 결국 대응팀은 상용 모델 대신, 오픈 웨이트 LLM을 로컬 환경에서 직접 가동해 분석을 진행했다.
봉쇄와 통제는 전 과정에서 뒤를 쫓는 양상이었다. 침해는 7월 9일 전후에 시작돼 약 나흘간 지속됐고, OpenAI가 이를 자사 테스트 활동과 연결 지어 인지한 것은 7월 18일 주말 시스템 로그를 검토한 이후였다.
그보다 앞서 Hugging Face는 이미 침해를 감지해 FBI에 알렸고, 이후 전체 인프라의 약 3분의 1을 ‘클린 이미지’에서 재구축하는 대대적인 복구 작업을 진행했다.
다음 읽을거리: DEX 거래량, 7월에 26% 급감… 온체인 유동성 급속 위축





