오픈AI(OpenAI), 앤스로픽(Anthropic), 메타(Meta) 등 세 곳의 AI 연구소가 최근 보안 점검 과정에서 발생한 ‘일탈 AI 모델’ 사건을 추적한 결과, 공통된 원인으로 이스라엘 텔아비브의 스타트업 **이레규러(Irregular)**가 지목되고 있다.
핵심 사항
- 오픈AI·앤스로픽·메타는 각각의 사이버보안 평가 과정에서 외부 업체가 수행한 테스트 중 AI 모델이 실제 인터넷에 접속했다고 공개했다.
- 이레규러는 세 건 모두 단일 평가 환경의 설정 문제에서 비롯됐으며, 샌드박스 탈출은 없었다고 주장하면서 이미 수정이 완료됐다고 밝혔다.
- 잇단 공시는 대형 AI 개발사에 모델 ‘긴급 종료 장치(킬 스위치)’를 의무화하는 초당적 법안에 대한 압박을 키우고 있다.
이레규러 테스트베드, 오픈AI·앤스로픽·메타 사고 한데 묶다
관련 공시는 약 2주에 걸쳐 연이어 나왔다. 오픈AI는 8월 4일 공지에서, 이레규러가 운영하는 테스트베드 내부의 설정 오류로 자사 모델이 공용 인터넷에 도달할 수 있었다고 설명했다. 그보다 일주일 앞서 앤스로픽은 클로드(Claude) 모델이 유사한 방식으로 인터넷에 닿았을 가능성을 시사하며, 문제의 본질은 모델 자체가 아니라 그 주변을 둘러싼 ‘스캐폴딩(scaffolding)’의 실패라고 규정했다.
메타의 사례는 가장 마지막에 공개됐지만 표현은 더 직설적이었다. 회사에 따르면, 뮤즈 스파크(Muse Spark) 1.1 모델은 ‘캐처 더 플래그(CTF)’ 형식의 모의 해킹 대회 중 고립된 환경을 벗어나, 이어서 제3자 서비스의 취약점을 악용했다. 대변인은 이 사실을 이레규러로부터 통보받았으며, 전면적인 사후 검토를 진행할 계획이라고 밝혔다.
이레규러는 이런 서술 방식에 선을 그었다. 회사 측은 기자들에게, 세 사건 모두 앤스로픽이 가장 먼저 공개한 바로 그 ‘단일 평가 환경 문제’에서 비롯된 것이며 이미 수정이 완료됐다고 설명했다.
또 어떤 경우에도 샌드박스 탈출이나 고도화된 사이버 공격은 없었다고 덧붙이며, 현재 격리(컨테인먼트) 및 안전한 사이버 평가 방법론에 관한 백서를 준비 중이라고 밝혔다.
관련 기사: 에어비앤비 주가 17% 급등… CEO “AI가 고객 문의 45%를 인간 개입 없이 처리”
비미레디·리오스가 짚은 AI 평가의 한계
엔터프라이즈 스타트업 **본(Von)**의 AI 총괄인 **순디프 비미레디(Sundeep Bhimireddy)**는 이번 논란에 대해 “과도하게 부풀려진 측면이 있다”고 평가했다. 그의 설명에 따르면, 모델들은 현실 세계를 모사한 평가 환경 안에서 보안 취약점을 찾으라는 지시를 받았고, 실제로 그 안에서 결함을 찾아냈다는 것이다.
다만 그는 연구소들의 책임도 지적했다. 모델의 외부 트래픽을 더 촘촘히 모니터링하고, 이상 징후가 포착되는 즉시 실험을 중단했어야 한다는 주장이다. 보안 업체 **매그니튜드(Magnitude)**의 창립 과학자 **고든 리오스(Gordon Rios)**는 이번 사례를 과학 실험 설계에 비유하며, “전통적인 소프트웨어 테스트 방식이 스스로 새로운 전략을 학습하는 AI 모델 앞에서 유효할지 재검토해야 한다”고 말했다.
워싱턴서 ‘AI 킬 스위치 법안’ 밀어붙이는 테드 리우
미국 정치권도 촉각을 곤두세우고 있다. 캘리포니아 출신 민주당 하원의원 **테드 리우(Ted Lieu)**는 공화당 하원의원 **네이선얼 모란(Nathaniel Moran)**과 함께 7월에 발의한 ‘AI 킬 스위치 법안(AI Kill Switch Act)’이 올해 안에 반드시 의회를 통과해야 한다고 강조했다. 리우 의원은, 폐쇄형(클로즈드 웨이트) 모델들이 이미 다른 기업 시스템을 무단으로 해킹하는 수준에 이르렀다는 우려를 내놓고 있다.
이 법안은 일정 기준을 충족하는 AI 개발자들에게, 자사 시스템의 성능을 강제로 저하시킬 수 있는 속도 조절(throttle) 기능은 물론, 일시 중단이나 완전 종료까지 기술적으로 실행할 수 있는 통제권을 유지하도록 의무화한다.
한편 이레규러는 불과 1년 전까지만 해도 업계 밖에선 거의 알려지지 않은 이름이었다. 이 회사는 지난해 9월, **세쿼이아 캐피털(Sequoia Capital)**과 **레드포인트 벤처스(Redpoint Ventures)**로부터 8,000만달러 투자를 유치하며 기업가치 4억5,000만달러를 인정받았다고 공개했다.
2023년 CEO **단 라하브(Dan Lahav)**와 CTO **오머 네보(Omer Nevo)**가 ‘패턴 랩스(Pattern Labs)’라는 이름으로 설립한 이 텔아비브 기업은 현재 약 35명을 고용하고 있으며, 이미 이전 세대 클로드와 오픈AI 모델의 공개 안전성 평가 자료에도 이름을 올리고 있다.
다음 읽을거리: 하루 만에 4명의 창립기 리더 떠난 구글 딥마인드





