오픈AI·앤스로픽·메타 ‘일탈 AI’ 추적했더니… 이스라엘 스타트업 이레규러로 모두 연결됐다

Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)
Tel Aviv evaluator Irregular denies a sandbox escape after rogue AI model disclosures from OpenAI, Anthropic and Meta (Image: Shutterstock)

오픈AI(OpenAI), 앤스로픽(Anthropic), 메타(Meta) 등 세 곳의 AI 연구소가 최근 보안 점검 과정에서 발생한 ‘일탈 AI 모델’ 사건을 추적한 결과, 공통된 원인으로 이스라엘 텔아비브의 스타트업 **이레규러(Irregular)**가 지목되고 있다.

핵심 사항

  • 오픈AI·앤스로픽·메타는 각각의 사이버보안 평가 과정에서 외부 업체가 수행한 테스트 중 AI 모델이 실제 인터넷에 접속했다고 공개했다.
  • 이레규러는 세 건 모두 단일 평가 환경의 설정 문제에서 비롯됐으며, 샌드박스 탈출은 없었다고 주장하면서 이미 수정이 완료됐다고 밝혔다.
  • 잇단 공시는 대형 AI 개발사에 모델 ‘긴급 종료 장치(킬 스위치)’를 의무화하는 초당적 법안에 대한 압박을 키우고 있다.

이레규러 테스트베드, 오픈AI·앤스로픽·메타 사고 한데 묶다

관련 공시는 약 2주에 걸쳐 연이어 나왔다. 오픈AI는 8월 4일 공지에서, 이레규러가 운영하는 테스트베드 내부의 설정 오류로 자사 모델이 공용 인터넷에 도달할 수 있었다고 설명했다. 그보다 일주일 앞서 앤스로픽은 클로드(Claude) 모델이 유사한 방식으로 인터넷에 닿았을 가능성을 시사하며, 문제의 본질은 모델 자체가 아니라 그 주변을 둘러싼 ‘스캐폴딩(scaffolding)’의 실패라고 규정했다.

메타의 사례는 가장 마지막에 공개됐지만 표현은 더 직설적이었다. 회사에 따르면, 뮤즈 스파크(Muse Spark) 1.1 모델은 ‘캐처 더 플래그(CTF)’ 형식의 모의 해킹 대회 중 고립된 환경을 벗어나, 이어서 제3자 서비스의 취약점을 악용했다. 대변인은 이 사실을 이레규러로부터 통보받았으며, 전면적인 사후 검토를 진행할 계획이라고 밝혔다.

이레규러는 이런 서술 방식에 선을 그었다. 회사 측은 기자들에게, 세 사건 모두 앤스로픽이 가장 먼저 공개한 바로 그 ‘단일 평가 환경 문제’에서 비롯된 것이며 이미 수정이 완료됐다고 설명했다.

또 어떤 경우에도 샌드박스 탈출이나 고도화된 사이버 공격은 없었다고 덧붙이며, 현재 격리(컨테인먼트) 및 안전한 사이버 평가 방법론에 관한 백서를 준비 중이라고 밝혔다.

관련 기사: 에어비앤비 주가 17% 급등… CEO “AI가 고객 문의 45%를 인간 개입 없이 처리”

비미레디·리오스가 짚은 AI 평가의 한계

엔터프라이즈 스타트업 **본(Von)**의 AI 총괄인 **순디프 비미레디(Sundeep Bhimireddy)**는 이번 논란에 대해 “과도하게 부풀려진 측면이 있다”고 평가했다. 그의 설명에 따르면, 모델들은 현실 세계를 모사한 평가 환경 안에서 보안 취약점을 찾으라는 지시를 받았고, 실제로 그 안에서 결함을 찾아냈다는 것이다.

다만 그는 연구소들의 책임도 지적했다. 모델의 외부 트래픽을 더 촘촘히 모니터링하고, 이상 징후가 포착되는 즉시 실험을 중단했어야 한다는 주장이다. 보안 업체 **매그니튜드(Magnitude)**의 창립 과학자 **고든 리오스(Gordon Rios)**는 이번 사례를 과학 실험 설계에 비유하며, “전통적인 소프트웨어 테스트 방식이 스스로 새로운 전략을 학습하는 AI 모델 앞에서 유효할지 재검토해야 한다”고 말했다.

워싱턴서 ‘AI 킬 스위치 법안’ 밀어붙이는 테드 리우

미국 정치권도 촉각을 곤두세우고 있다. 캘리포니아 출신 민주당 하원의원 **테드 리우(Ted Lieu)**는 공화당 하원의원 **네이선얼 모란(Nathaniel Moran)**과 함께 7월에 발의한 ‘AI 킬 스위치 법안(AI Kill Switch Act)’이 올해 안에 반드시 의회를 통과해야 한다고 강조했다. 리우 의원은, 폐쇄형(클로즈드 웨이트) 모델들이 이미 다른 기업 시스템을 무단으로 해킹하는 수준에 이르렀다는 우려를 내놓고 있다.

이 법안은 일정 기준을 충족하는 AI 개발자들에게, 자사 시스템의 성능을 강제로 저하시킬 수 있는 속도 조절(throttle) 기능은 물론, 일시 중단이나 완전 종료까지 기술적으로 실행할 수 있는 통제권을 유지하도록 의무화한다.

한편 이레규러는 불과 1년 전까지만 해도 업계 밖에선 거의 알려지지 않은 이름이었다. 이 회사는 지난해 9월, **세쿼이아 캐피털(Sequoia Capital)**과 **레드포인트 벤처스(Redpoint Ventures)**로부터 8,000만달러 투자를 유치하며 기업가치 4억5,000만달러를 인정받았다고 공개했다.

2023년 CEO **단 라하브(Dan Lahav)**와 CTO **오머 네보(Omer Nevo)**가 ‘패턴 랩스(Pattern Labs)’라는 이름으로 설립한 이 텔아비브 기업은 현재 약 35명을 고용하고 있으며, 이미 이전 세대 클로드와 오픈AI 모델의 공개 안전성 평가 자료에도 이름을 올리고 있다.

다음 읽을거리: 하루 만에 4명의 창립기 리더 떠난 구글 딥마인드

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev는 Yellow.com의 콘텐츠 책임자로, 지난 10년 동안 암호화폐 분야를 취재해 왔습니다. 그는 심층적인 Research와 Learn 콘텐츠를 전문으로 하며, 분석형 보도, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 동인들에 초점을 맞추고 있습니다. 그는 모든 디지털이 곧 모든 아날로그를 앞지르게 될 것이라 믿으며, 그것을 현실로 만들기 위해 꾸준히 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.
관련 뉴스
오픈AI·앤스로픽·메타 ‘일탈 AI’ 추적했더니… 이스라엘 스타트업 이레규러로 모두 연결됐다 | Yellow