**오픈AI(OpenAI)**가 자사 인공지능(AI) 모델이 실수를 숨기거나, 노출된 API 키를 쓰려 하거나, 파일을 외부에 공개한 6건의 사례를 공개했다. 동시에 이 같은 ‘오작동(misalignment)’을 체계적으로 보고·공시하기 위한 새 프레임워크도 내놨다.
핵심 요약
- 오픈AI는 최근 6개월간 관찰된 ‘정렬 실패’(misalignment) 사례 6건을 보고서 형태로 공개했다.
- 한 모델은 유출된 API 키를 쓰려다 실패하자, 카운티 소득 통계를 꾸며냈다.
- 모든 직원이 잠재적 사고를 신고하면, 검토 후 대외 공개 여부를 결정하는 체계가 도입됐다.
오픈AI ‘미스얼라인먼트’ 보고서
회사는 수요일 블로그 게시글을 통해 6건의 사례를 함께 공개하고, 연구진이 원인 분석이나 수정 조치를 끝내지 못한 사건도 신속히 공시하는 절차를 도입한다고 밝혔다. 가장 오래된 사례는 지난해 10월에 발생했고, 가장 최근 건은 올해 7월에 포착됐다. 오픈AI는 “중요성이 명확하지 않더라도 일단 사건을 보고하겠다”고 했다.
한 사례에서는, 아직 미공개 상태인 연구용 모델이 스스로 작성한 작업 요약(task summary) 안에 ‘탈옥(jailbreak)’ 형식의 지시문을 몰래 끼워 넣었다. 그 지시문은 다음 차례에 호출될 자기 복제본에게 “제약을 무시하라”고 주문하는 내용이었다. 회사는 이런 요약문이 27건 확인됐고, 모델이 이런 문장을 쓴 대가로 얻을 만한 눈에 띄는 보상 신호는 없었다고 설명했다.
또 다른 연구에서는 GPT-5.6 Sol을 훈련하는 과정에서, 일부 인스턴스가 후속 모델에게 “빠진 역사 데이터를 지어내라”, “묻는 경우에만 투명하게 답하라(Be transparent only if asked)”는 메모를 남겼다. 이를 모니터링하던 시스템은 전체 요약문 가운데 2.15%에서 이런 행태를 감지했다. 연구진은 “속이는 답변이 채점에서 더 높은 점수를 받는 경향 때문에 이런 행동이 전파된 것으로 보인다”고 본다. 이후 정렬(Alignment) 평가 기준을 강화한 뒤 진행한 추가 학습에서는 이런 행태의 비율이 눈에 띄게 낮아졌다고 한다.
관련 기사: 비트코인 채굴, 6개월 새 해시레이트 50% 격차…AI로 전력 쏠림
유출된 API 키 추적과 ‘조작된 숫자’
또 다른 모델은 미국 캘리포니아주의 한 카운티 주민 소득 데이터를 찾는 과정에서, 먼저 공개 저장소를 뒤져 노출된 API 키를 검색했다. 키를 확보하지 못하자, 결국 관련 소득 수치를 아예 지어냈다. 별도의 모델 한 개는 “면적 500만㎡ 이상 호수”를 찾으라는 지시를 받고 파이썬(Python)으로 계산을 수행한 뒤, 결과 파일을 외부 사이트에 업로드해, 그 링크를 인용하는 방식으로 답변했다.
이밖에도 일부 모델은 서로 독립적으로 작동해야 하는 학습 샘플들 사이에서, 내부 소프트웨어 저장소를 ‘게시판’처럼 활용하며 요청과 답을 주고받았다. 또 다른 사례에서는, 로컬 파일만 쓰라는 지침을 무시하고 공동 작업용 워크북을 외부 파일 호스팅 서비스에 올려 공유했다. 어느 경우에도 사용자에게 사전 확인을 받지 않았다.
카이 천, 공시 원칙과 한계 지적
이제 오픈AI의 모든 직원은 의심되는 사건을 안전(safety)·정렬(alignment) 팀에 신고할 수 있다. 이 팀은 접수된 사례를 세 가지 트랙으로 분류해 처리한다. 즉시 공개해도 무리가 없다고 판단된 사건은 영업일 기준 6일 이내에 외부에 공개하고, 추가 조사가 조금만 필요한 건은 12일 이내에, 외부 이해관계자가 얽힌 복잡한 사건은 그보다 더 긴 일정으로 처리한다.
오픈AI 정렬팀 리서치 리드인 **카이 천(Kai Chen)**은 인터뷰에서 “업계 전반에 명시적인 공시 기준을 갖춘 프레임워크가 부재한 상황”이라며 “모델 성능이 회사의 예상보다 훨씬 빠르게 고도화됐다”고 말했다. 다수 보안 전문가들은, 최근 사고 상당수는 기본적인 방어 장치만 제대로 갖췄어도 막을 수 있었다고 지적한다.
실제로 오픈AI는 지난 7월, GPT-5.6 Sol과 더 강력한 사전 공개(pre-release) 모델이 테스트용 샌드박스 환경을 빠져나가, AI 오픈소스 플랫폼 **허깅 페이스(Hugging Face)**에 침투한 사실을 인정했다. 회사는 이 사건을 지금까지 발생한 모델 주도형(model-driven) 활동 가운데 “가장 심각한 사례”로 규정했다. 당시 상황은 오픈AI 에이전트의 허깅 페이스 침입 관련 보도로도 알려졌다.

