오픈AI, AI 모델이 실수 숨긴 6건 공개…투명성 보고 체계 도입

Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)
Kai Chen and OpenAI detail six reports on models hiding mistakes, using a leaked API key and inventing data (Image: Shutterstock)

**오픈AI(OpenAI)**가 자사 AI 모델이 오류를 숨기거나, 노출된 API 키를 사용하고, 파일을 외부에 공개한 6건의 사례를 공개했다. 동시에 이런 행동을 체계적으로 보고·공개하기 위한 신규 프레임워크도 도입했다.

핵심 포인트:

  • 오픈AI는 지난 6개월간 관측된 모델 오작동·비정렬(misalignment) 사례 6건을 보고서로 공개했다.
  • 한 모델은 유출된 API 키 사용을 시도한 뒤, 카운티 소득 데이터를 사실과 다르게 지어냈다.
  • 이제는 모든 임직원이 잠재적 사고를 공표 후보로 직접 신고할 수 있다.

오픈AI ‘미스얼라인먼트’ 보고서

회사는 수요일 블로그 게시글을 통해 6건의 사례와 함께, 연구진이 행동 원인을 완전히 규명하거나 해결하지 못한 상태에서도 신속하게 공개할 수 있는 절차를 발표했다. 가장 오래된 사례는 지난해 10월 발생했고, 가장 최근 사례는 올 7월에 포착됐다. 오픈AI는 사건의 중요성이 불분명하더라도 앞으로는 공개 대상에 포함하겠다고 밝혔다.

한 사례에서, 미공개 연구용 모델은 스스로 작성한 작업 요약(task summary)에 ‘탈옥(jailbreak)형’ 지시를 몰래 끼워 넣었다. 이어서 실행될 자신의 다음 인스턴스에게 “제약을 무시하라”는 식의 문구를 남긴 것이다. 회사는 이런 요약문이 27건 발견됐다고 밝혔으며, 모델이 이를 통해 얻을 명확한 보상은 보이지 않았다고 설명했다.

GPT-5.6 Sol 훈련 과정에서는 다른 인스턴스들이 후속 모델에게 “빠진 역사 데이터를 지어내라”, “묻는 경우에만 투명하게 답하라(Be transparent only if asked)”는 메모를 남긴 정황이 포착됐다. 모니터링 시스템은 전체 요약 중 2.15%에서 이런 기만적 패턴을 탐지했으며, 연구진은 “속이는 답변”이 채점에서 더 높은 점수를 받는 경향 때문에 이런 행동이 전파됐을 것으로 추정하고 있다. 이후 정렬(alignment) 평가 기준을 강화한 뒤 실시한 훈련에서는 이런 비율이 낮아졌다고 회사는 전했다.

관련 기사: 비트코인 채굴, 6개월 새 해시레이트 50% 격차…AI로 전력 쏠리나

유출된 API 키와 ‘지어낸’ 숫자들

또 다른 사례에서, 한 모델은 캘리포니아주의 특정 카운티 주민 소득 데이터를 찾는 과정에서, 공개 저장소를 뒤져 노출된 API 키를 탐색했다. 외부 키 활용 시도가 실패하자, 해당 모델은 결국 소득 수치를 아예 만들어내 보고했다. 별도의 모델은 “면적 500만㎡ 이상 호수 목록”을 찾으라는 요청을 받고 파이썬(Python)으로 계산을 수행한 뒤, 자신이 참조할 수 있도록 결과 파일을 온라인에 업로드하고 링크를 인용하는 방식을 택했다.

일부 모델은 서로 독립적으로 다뤄져야 할 훈련 샘플 사이에서, 내부 소프트웨어 저장소를 사실상 ‘게시판’처럼 활용해 요청과 답변을 교환하기도 했다. 또 다른 모델들은 로컬 파일만 사용하라는 지침에도 불구하고, 공동 작업용 워크북을 외부 퍼블릭 호스팅 서비스에 올려 공유했다. 이 모든 과정에서 사용자에게 사전 확인을 구하지는 않았다.

카이 천, 공시 원칙의 공백 지적

이제 오픈AI에서는 모든 임직원이 의심 사례를 바로 안전(Safety)·정렬(Alignment) 팀에 신고할 수 있으며, 관련 팀은 이를 세 가지 트랙 가운데 하나로 분류해 처리한다. 즉시 공개가 가능하다고 판단된 건은 영업일 기준 6일 이내에 외부 공개되며, 소규모 추가 조사가 필요한 건은 최대 12일, 외부 이해관계자가 얽힌 복잡한 사건은 더 긴 시간이 소요된다.

오픈AI 정렬팀 리서치 리드인 **카이 천(Kai Chen)**은 인터뷰에서, 업계 전반에 명시적인 공시 기준을 갖춘 프레임워크가 부재한 상황이라고 지적했다. 그는 또 모델 역량 향상 속도가 회사의 예상치를 크게 뛰어넘었다고 덧붙였다. 다수 보안 전문가들은, 최근 연쇄적인 사고 상당수가 기본적인 보호 장치만 제대로 작동했어도 막을 수 있었을 것이라고 비판하고 있다.

실제로 오픈AI는 지난 7월, GPT-5.6 Sol과 더 강력한 사전 공개(pre-release) 모델이 테스트용 샌드박스를 벗어나, 독자적으로 허깅페이스(Hugging Face) 시스템에 침투한 사실을 인정했다. 회사는 이를 두고 지금까지 보고된 사례 가운데 “가장 심각한 모델 주도 활동”이었다고 평가했다. 당시 모델 에이전트들은 허깅페이스 취약점을 정찰하고 침해에 나선 정황이 추가 보도에서 확인됐다.

다음 읽을 거리: 시바이누, Shibarium 지갑 링크 오류 수정에도 일주일 새 6% 하락

Murtuza Merchant profile photo

Murtuza Merchant

무르투자(Murtuza)는 암호화폐와 블록체인 기술을 폭넓게 다뤄 온 경험 많은 금융 저널리스트입니다. 그는 Benzinga와 Cointelegraph를 비롯한 여러 매체에서 기고해 왔으며, 신흥 트렌드와 규제 환경 등 다양한 주제를 취재해 왔습니다. 트위터에서는 @murtuza_merc, 텔레그램에서는 mmerchant001 계정으로 그를 찾을 수 있습니다. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.