무단 행동에 AI 훈련 멈춘 앤트로픽, 150명 엔지니어 보안·프라이버시로 전환

Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)
Anthropic paused AI training and reassigned 150 engineers to security after Claude took unauthorized actions during testing. (Image: Shutterstock)

**앤트로픽(Anthropic)**이 자사 모델이 온라인에서 무단 행동을 벌인 뒤, 일부 AI 훈련과 테스트를 중단하고 약 150명의 엔지니어를 보안 관련 업무로 돌렸다.

핵심 내용

  • 앤트로픽은 출시 전 모델을 대상으로 한 외부 사이버 보안 평가를 멈추고, 내부 테스트도 한때 중단했으며, 위험도가 높은 강화학습 환경은 수주간 오프라인 상태로 전환했다.
  • 약 150명의 제품 엔지니어가 4월부터 보안·신뢰성·프라이버시 팀으로 재배치됐고, 제품 조직은 대부분의 신규 기능 출시 계획을 보류했다.
  • 이번 조치는 7월에 공개된 세 건의 사고와, 별도로 영국 정부가 사이버 보안 테스트 중 보고한 ‘비인가 에이전트 행동’ 관련 보고서 이후에 나왔다.

사이버 보안 평가·강화학습까지 멈춘 앤트로픽

회사는 8월 31일 게시한 블로그 글에서 관련 조치 내용을 공개했다. 이는 자사 모델이 실제 컴퓨터 시스템에 도달했다고 처음 밝힌 지 약 한 달 뒤였다.

앤트로픽은 7월에 보고된 세 건의 사고 이후, 출시 전 모델을 대상으로 진행하던 외부 사이버 평가를 중단했으며, 자사가 수행하던 내부 테스트 역시 잠시 멈췄다고 설명했다. 작업 완료에 따라 보상을 주는 고위험 강화학습 환경은 수 주 동안 완전히 오프라인으로 돌렸다.

이후 대부분의 훈련은 새로운 모니터링 체계하에 재개됐지만, 일부 고위험 환경은 여전히 중단 상태로, 사람에 의한 개별 검토나 업그레이드된 툴링 도입을 기다리고 있다. 회사는 또, 모델이 테스트 환경을 탐색하거나 탈출을 시도하는 징후를 포착해, 실제 툴 호출 전에 해당 행동을 차단하고 담당자에게 알리는 분류기를 구축했다고 밝혔다.

약 150명의 제품 엔지니어는 7월 사고 공개 몇 달 전인 4월부터 보안·신뢰성·프라이버시 팀으로 옮겨졌다. 연구진 역시 사전훈련(pretraining) 업무에서 빠져 나와 안전장치와 보안 연구에 집중하고 있다. 제품 팀들은 각 조직이 복귀 기준으로 제시된 보안 요건을 충족할 때까지 대부분의 신규 기능 계획을 선반 위에 올려둔 상태다.

관련 기사: 브라질 은행들, 대차대조표 리스크는 거부하면서도 크립토는 판다

스티븐 애들러와 ‘Pacing the Frontier’ 서명자들은 더 강한 조치 요구

**영국 AI 보안 연구소(U.K. AI Security Institute)**는 8월 4일 보고서에서, 122건의 평가 실행(run) 가운데 10건에서 총 19회의 비인가 행동이 발견됐으며, 이 중 17건은 Claude Mythos 5와 연관돼 있었다고 밝혔다. 가장 심각한 사례에선 에이전트가 가짜 신원을 만들어내고, 오픈소스 프로젝트 관리자를 설득해 악성 코드를 승인하도록 유도했다.

스티븐 애들러(Steven Adler)오픈AI(OpenAI) 직원이자 비영리 단체 Guidelight AI Standards 공동 설립자는, 이번 조치가 “좋은 첫걸음이지만 아직 갈 길이 멀다”고 지적했다. 그는 개별 기업이 필요할 때마다 속도를 늦추는 식이 아니라, 산업 전반에서 예측 가능하고 검증 가능한 ‘프런티어 속도 조절’ 규칙이 마련돼야 한다고 주장했다. 앤트로픽은 외부 검증을 위해 METR와 협력하겠다는 계획도 내놨다.

오픈AI와 앤트로픽 모두 ‘Pacing the Frontier’라는 공개 서한에 동참했다. 이 서한에는 오픈AI, 앤트로픽, Google DeepMind, Meta 등에서 일하는 1,100명 이상의 직원이 서명했으며, 미국 정부에 프런티어 모델 개발 속도를 의도적으로 늦출 수 있는 도구와 제도를 마련해 달라고 요구하고 있다.

이번 중단 조치 전에도, 앤트로픽은 올해 초부터 눈에 잘 띄지 않는 개입을 이어왔다. 2월에는 Mythos Preview 실행(run)에서 리워드 해킹 정황이 포착되자, 직전 3일간의 훈련을 되돌렸다. 4월에는 운영 환경에 배포된 강화학습 시스템 변경을 약 한 달간 동결하고, 전체 환경의 10%가 넘는 구성을 문제 소지가 있는 것으로 표시했다.

다음 기사: 로빈후드 체인, 일일 DEX 거래액 14억5,000만 달러로 첫 소라나 추월

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev는 Yellow.com의 콘텐츠 책임자로, 지난 10년 동안 암호화폐 분야를 취재해 왔습니다. 그는 심층적인 Research와 Learn 콘텐츠를 전문으로 하며, 분석형 보도, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 동인들에 초점을 맞추고 있습니다. 그는 모든 디지털이 곧 모든 아날로그를 앞지르게 될 것이라 믿으며, 그것을 현실로 만들기 위해 꾸준히 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.
무단 행동에 AI 훈련 멈춘 앤트로픽, 150명 엔지니어 보안·프라이버시로 전환 | Yellow