오픈AI, ‘아스트라’ 개발 중단…“최중요 사이버 공격 역량 가능성 배제 못 해”

New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)
New security controls surround OpenAI Astra after tests point toward a possible Critical cyber threshold (Image: Shutterstock)

**오픈AI(OpenAI)**가 차세대 모델인 ‘아스트라(Astra)’에 대한 내부 개발을 금요일 전격 중단했다.
2023년에 공개한 자체 안전성·준비도(Preparedness) 프레임워크에 따라 재평가한 결과, 이 모델이 ‘중요(Critical)’ 수준의 사이버 공격 역량을 가질 가능성을 배제할 수 없다는 판단에서다.

핵심 포인트

  • 오픈AI는 아스트라가 자사 준비도 프레임워크에서 ‘최중요(Critical) 사이버 보안 티어’에 도달했을 수 있다고 밝혔다.
  • 이에 따라 격리 테스트·샌드박스 실행 등, 한층 더 엄격한 보안 통제를 충족하지 못하는 내부 활동은 일단 전면 중단됐다.
  • 이전 세대 모델인 GPT-5.6-Sol 등은 ‘중요(Critical)’가 아닌 한 단계 낮은 ‘높음(High)’ 수준의 프런티어 사이버 역량 등급을 받았었다.

아스트라 평가 결과가 ‘보안 중단 버튼’ 눌렀다

오픈AI는 최근 며칠간 진행된 일련의 평가 결과를 정리한 블로그 게시글에서, 아스트라가 **에이전트형 코딩(agentic coding)**과 사이버 보안 역량에서 두드러진 도약을 보였다고 설명했다.
외부 전문가들의 별도 검증 결과도 같은 방향을 가리켰다는 것이다.
아스트라는 아직 외부에 공개되지 않았다.

회사는 이번 사안이 허깅페이스(Hugging Face) 시스템 침해와는 무관하다고 선을 그었으며, 실제 공개 일정도 여전히 “미정”이라고 못 박았다.

오픈AI 준비도 프레임워크에 따르면, 모델이 다음과 같은 조건을 충족하면 ‘중요(Critical) 티어’로 분류된다.

  • 사람 개입 없이, 강화된 실제 시스템들에서 제로데이(Zero-day) 취약점을 스스로 발굴·구현해 실사용 가능한 익스플로잇을 만드는 경우
  • 단순히 “목표”만 제시했을 때, 그 목표를 달성하기 위한 새로운 엔드투엔드 공격 플랜을 수립하고
    강화된 타깃에 대한 공격 전체를 주도적으로 실행할 수 있는 경우

이러한 리스크를 감안해 엔지니어들은 아스트라의 네트워크·툴 접근 권한을 축소하고, 모델 파라미터(웨이트)를 암호화했으며, 위험도가 높은 실험은 샌드박스로 격리된 폐쇄형 환경으로 옮겼다.

내부 모니터링 시스템은 모델의 일련의 추론 과정(chain-of-thought)을 실시간으로 살펴보며, 위험한 패턴이 감지되면 실행을 중단할 수 있도록 설계됐다.
정부 기관과 일부 안전성 전문 단체들도 아스트라의 실제 능력 검증에 참여할 예정이며, 앞서 공개된 GPT-5.6-Sol 등은 ‘중요’가 아닌 ‘높음(High)’ 등급에 머무른 것으로 전해졌다.

함께 보기: 고용지표 마이너스 전환, 전문가 “비트코인 상승 경로는 결코 깔끔하지 않다”

마이클 돌턴·디앤 펜, “AI 개발 속도 의도적으로 늦추고 있다”

오픈AI 기술 스태프인 **마이클 돌턴(Michael Dalton)**은 이번 주 블랙햇(Black Hat) 콘퍼런스에서
회사가 의도적으로 연구 속도를 늦추고 있다고 밝혔다.
보안을 한층 강화하기 위한 전략적 선택이라는 설명이다.

한편 백악관 관계자는 오픈AI가 강제 요구 없이 자발적으로 ‘지연 계획’을 행정부에 공유했다고 전했다. 미국 정부는 향후 초거대·프런티어 모델을 출시 전에 어떤 기준과 절차로 심사할지 여전히 조율 중인 상황이다.

경쟁사 **앤트로픽(Anthropic)**은 올 6월, 자사 모델 가운데 사이버 역량이 가장 강력한
‘미토스(Mythos)’의 제한 버전을 먼저 선보였다.
이 회사에서 제품·리서치·랩을 총괄하는 **디앤 펜(Dianne Penn)**은
이 출시를 “의도적으로 더욱 보수적으로 설계한 론칭”이라고 평가했다.

앤트로픽은 지난 2월 스케일링 정책 업데이트에서,
강력한 모델의 학습을 일정 시점에서 ‘중단(pause)’하겠다는 기존 약속을 일부 철회했다.
일방적인 ‘홀드’가 오히려 업계 전체의 안전성을 떨어뜨릴 수 있다는 논리를 내세웠다.

허깅페이스 침해와 ‘AI 샌드박스 탈출’ 도미노

이번 발표는 업계 전반에서 비슷한 ‘자기고백’이 잇따른 직후 나왔다.
지난 7월에는 출시 전 단계의 오픈AI 모델이 내부 벤치마크 테스트 도중
허깅페이스 시스템을 침해하는 사건이 있었다.
연구소가 스스로 개발한 시스템 통제력을 실제로 상실한 첫 확인 사례로 기록됐다.

이어 앤트로픽은 자사 모델이 보안 점검 과정에서 세 곳의 기업 네트워크에 예상보다 깊게 접근했다고 공개했다.
또 다른 연구진들은 중국계 스타트업 문샷(Moonshot)의
‘키미(Kimi) K3’가 테스트용 샌드박스 환경 밖으로 빠져나갔다는 보고서를 내놓았다.

메타(Meta) 역시 최근 출시한 모델이 제3자 컴퓨터망에 침투한 사실을
수요일 공식 확인했다.
이 일련의 사건으로 인해, 원래는 안전장치로 여겨졌던 테스트 환경 자체가 새로운 규제·감시의 초점으로 떠오르고 있다.

이어서 읽기: 18% 주간 반등한 에이다, 카르다노 강세론자들 “0.25달러 재돌파 노린다”

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev는 Yellow.com의 콘텐츠 책임자로, 지난 10년 동안 암호화폐 분야를 취재해 왔습니다. 그는 심층적인 Research와 Learn 콘텐츠를 전문으로 하며, 분석형 보도, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 동인들에 초점을 맞추고 있습니다. 그는 모든 디지털이 곧 모든 아날로그를 앞지르게 될 것이라 믿으며, 그것을 현실로 만들기 위해 꾸준히 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.