인류 멸종 위험 10% 넘나…앤트로픽 수석 연구원 “AI가 모두 죽일 확률 두 자릿수”

A delayed Anthropic IPO timeline keeps a possible $2 trillion valuation in focus ahead of a mid-October launch. (Image: Shutterstock)
A delayed Anthropic IPO timeline keeps a possible $2 trillion valuation in focus ahead of a mid-October launch. (Image: Shutterstock)

Anthropic 연구원 **제이컵 콕슨(Jacob Coxon)**이 통제 불가능한 AI에 대한 우려를 이유로 이번 주 사표를 냈고, 이에 대해 회사의 정렬(안전성) 책임자는 “향후 10년 안에 인류 멸종 확률을 10% 이상으로 본다”고 공개적으로 밝혔다.

핵심 포인트

  • 콕슨은 OpenAI와 Anthropic에서 3년간 프리트레이닝(사전학습) 연구를 한 뒤, 두 회사 모두 통제 불가능한 시스템을 향해 ‘레이스’를 벌이고 있다며 퇴사했다.
  • Anthropic 정렬 과학 책임자인 에번 허빙어(Evan Hubinger)는 “향후 10년 이내 AI가 인류를 전멸시킬 개인적 확률 추정치를 10% 이상”이라고 제시했다.
  • 허빙어는 “현재 세대 모델은 위험이 낮다”고 선을 그으면서도, 스스로를 개선하며 후속 모델을 훈련하는 ‘재귀적 자기개선(recursive self-improvement)’에 우려를 집중했다.

“AI 레이스가 통제를 벗어나고 있다” 콕슨, 앤트로픽 떠나

27세인 콕슨은 OpenAI와 Anthropic에서 3년간 프리트레이닝 연구를 수행한 뒤, 수요일 새벽 소셜미디어 X에 연달아 글을 올리며 사직 사실을 밝혔다. 그는 글에서 “두 회사 모두 책임 있게 행동하지 않고 있으며, 스스로 학습하는 초지능을 향해 인류의 생명을 담보로 도박을 벌이고 있다”고 비판했다. 그의 첫 게시물은 몇 시간 만에 조회수 1,900만 회 이상을 기록했다.

별도의 인터뷰에서 그는, 가장 공격적인 시나리오들이 이미 궤도에 올랐으며, “내년 말이면 상황이 완전히 통제를 벗어날 수 있다”고 경고했다. 동료들 사이에서는 현재 상황을 가리켜 ‘크런치타임(crunchtime)’, ‘엔드게임(endgame)’ 같은 단어가 공공연히 쓰이고 있다고 전했다.

수학 전공자인 콕슨은 이후 모델 트레이닝 분야로 옮겼고, 올해 초에는 안전성에 더 무게를 둔다는 평판을 이유로 OpenAI를 떠나 Anthropic에 합류했다. 하지만 경쟁 연구소 간 속도전이 본격화되면 “안전에서 타협은 피할 수 없다”고 지적했다. 그는 이제 “정부 개입이나 업계 전반의 속도 조정 없이, 어느 한 회사가 책임 있게 인간 수준의 AI를 만들 수 있다고 믿기 어렵다”고 주장한다.

관련 기사: 고래 매집 재개에 리플(XRP) 1.46달러 재도전

에번 허빙어 “인류 전멸 확률, 개인적으론 10% 이상”

Anthropic의 정렬 과학을 총괄하며 자체 모델에 대한 스트레스 테스트를 수행하는 **에번 허빙어(Evan Hubinger)**는, 콕슨이 묘사한 상황이 “대체로 사실에 가깝다”고 인정했다. 그는 한 인터뷰에서, 향후 10년 안에 AI가 인류를 전멸시킬 가능성을 “개인적으로 10%를 넘는 수준”으로 추산한다고 말했다.

허빙어는 “회사 차원에서 가능한 최선을 다하고 있다”고 전제하면서도, 초지능(superintelligence)에 대한 정렬 문제를 해결할 구체적 설계도(플랜)는 없고, 그 해법을 향해 뚜렷하게 진전하고 있다고 보기도 어렵다고 토로했다. 그는 이후 추가 설명에서 “현재 상용화된 모델 자체의 위험은 낮다”고 강조하며, 우려의 초점을 재귀적 자기개선에 맞췄다. 즉, 현 세대 모델이 후속 세대를 직접 설계·훈련하는 구조가 열리면, 인간이 이해하거나 제어하지 못하는 속도로 능력이 증폭될 수 있다는 시나리오다.

허빙어의 수치는 회사 공식 전망이 아닌 개인적 판단이며, 이 같은 숫자는 미래 기술 역량과 배치 방식에 대한 여러 가정에 크게 의존한다. Anthropic은 공개적으로, 재귀적 자기개선이 “필연적”이라고 보지는 않지만, 제도·규제가 대비하기 전에 도래할 가능성을 배제하기 어렵고, 그 경우 인간이 통제력을 잃을 확률을 끌어올릴 수 있다고 밝힌 바 있다.

잇따르는 안전성 인력 이탈…앤트로픽에 드리운 그늘

콕슨은 떠나는 첫 안전성 연구자가 아니다. 회사에서 세이프가드 팀을 이끌었던 **므리낭크 샤르마(Mrinank Sharma)**도 올해 초 회사를 그만두며 “세계가 중대한 위험에 처해 있다”고 경고했다. 그는 영국으로 건너가 시(詩)를 공부하겠다고 밝혀, 업계 안팎의 관심을 모았다.

2021년, OpenAI 출신들이 창업한 Anthropic은 “안전성 연구를 최우선에 두는 연구소”라는 이미지로 투자자와 규제당국의 관심을 끌어왔다. 그만큼 안전성 핵심 인력의 연쇄 이탈은 회사의 브랜드와 신뢰도에 부담으로 작용할 수 있다. 수요일 오전 기준, Anthropic은 콕슨의 공개 사직과 관련해 별도의 공식 입장을 내놓지 않았다.

다음 읽을거리: Bitget, 64만 명 이상 참여한 UNICEF 프로그램에 블록체인 교육 추가

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev는 Yellow.com의 콘텐츠 책임자로, 지난 10년 동안 암호화폐 분야를 취재해 왔습니다. 그는 심층적인 Research와 Learn 콘텐츠를 전문으로 하며, 분석형 보도, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 동인들에 초점을 맞추고 있습니다. 그는 모든 디지털이 곧 모든 아날로그를 앞지르게 될 것이라 믿으며, 그것을 현실로 만들기 위해 꾸준히 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.
관련 뉴스
인류 멸종 위험 10% 넘나…앤트로픽 수석 연구원 “AI가 모두 죽일 확률 두 자릿수” | Yellow