**오픈AI(OpenAI)**가 신형 모델 GPT-6 아스트라의 출시 직후 제기된 “점점 멍청해졌다”는 이용자 불만의 배경에 있던 세 가지 결함을 수정하고, 코덱스(Codex) 구독자의 사용 한도를 다시 설정했다.
핵심 내용
- 아스트라 이용자들은 출시 직후와 현재 버전을 나란히 비교 테스트하며, 모델이 조용히 ‘너프’(약화)됐다고 주장해 왔다.
- 오픈AI 코덱스 총괄 티보 소티오(Tibo Sottiaux)는 그 원인으로 맥락 관리 실험 등 세 가지 결함을 지목했으며, 이 실험은 약 4천~5천명에게 영향을 미쳤다.
- 이전 플래그십 모델 GPT-5.6 솔(Sol) 역시 지난 7월 비슷한 ‘성능 하향’ 의혹에 휘말린 바 있다.
오픈AI, 아스트라 품질 저하 원인 밝혀…“수정 완료”
코덱스 제품 총괄 티보 소티오는 토요일 공개된 업데이트 공지에서 팀이 이용자들과 함께 문제를 추적한 뒤, 수정 패치를 배포하고 자정 이전에 사용 한도 전체를 초기화했다고 밝혔다. 그의 설명에 따르면, 이전 세대 모델을 위해 설계된 ‘스킬’들이 과도하게 작동하면서, 아스트라가 스스로 결과물을 재검증하는 과정을 방해하는 경우가 적지 않았다.
선택형 기능이었던 맥락 관리(context management) 실험도 문제였다. 이 기능은 일부 상황에서 모델이 답변을 조기에 멈추거나, 이미 지나간 대화에 엉뚱하게 응답하도록 만들 수 있었고, 테스트에 참여한 약 4,000~5,000명 규모 이용자에게 영향을 줬다. 오픈AI는 결국 해당 실험을 중단했다.
일부 연산 엔진은 설정이 잘못 잡혀, 그 엔진을 거쳐 가는 ‘꼬리 트래픽’의 응답 품질을 눈에 띄게 떨어뜨렸다. 회사는 이 엔진들을 라우팅 대상에서 제거하고, 여러 세부적인 품질 개선도 함께 반영했다. 소티오는 자신의 X 게시글에서 “이제 모델이 사용자의 최신 메시지를 더 정확하게 추적한다”고 강조했다.
관련 기사: 이더리움, ETF 자금 유입 2억1,600만달러에도 2,800달러 매물벽 직면
개발자들 “코드 품질 퇴보”…아스트라 회의론 확산
논란은 일주일 내내 X(옛 트위터)를 중심으로 증폭됐다. 개발자들은 같은 프롬프트와 같은 설정을 적용해 출시 당일 버전 아스트라와 현재 버전을 병렬로 실행한 뒤, 결과물을 나란히 비교해 공개했다.
불과 며칠 전까지 아스트라를 극찬했던 개발자 **프란잘 팔리왈(Pranjal Paliwal)**은 과거 아스트라가 작성해준 코드를 다시 검토한 뒤, “진전이 아니라 퇴보(regression)에 가깝다”고 평가를 뒤집었다.
코딩 도구 오픈코드(Opencode)를 개발하는 닥스 라드(Dax Raad) 역시 비용 대비 효용이 떨어진다고 보고, 팀의 메인 모델을 다시 이전 세대인 GPT-5.6 솔로 되돌렸다. 아스트라 도입 이후 지출이 두 배로 늘었지만, 체감 성능은 그만한 값을 하지 못했다는 판단이다.
한 커뮤니티 이용자는 포럼 글에서 아스트라를 평가하며 “동일 작업·동일 재시도 조건에서 이제는 솔과 큰 차이가 없다”고 주장했다. 반면 모두가 이 해석에 동의하는 것은 아니다. 익명 필명 **안티키테라(Antikythera)**로 활동하는 또 다른 이용자는 “아스트라는 원래부터 다소 게으르고, 불릿 포인트를 과하게 선호했다”며 “이용자들이 이제 더 이상 ‘와우 효과’에 속지 않을 뿐”이라고 반박했다.
GPT-6 아스트라를 짓누르는 연산·요금 구조
아스트라는 9월 초 폭넓은 공개 이후 내내 ‘용량 제약’ 이슈에 시달려 왔다.
여러 이용자 증언에 따르면 오픈AI는 챗GPT를 과도하게 사용하는 헤비 유저를 대상으로 아스트라 사용 한도를 줄였고, 월 200달러 수준의 신규 프로(Pro) 구독도 중단했다. 이 조치는 소티오가 9월 10일 관련 인터뷰에서 직접 확인했다.
가격 체계는 그대로다. 아스트라는 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러를 유지하고 있다. 이는 출시 당시 기준으로 솔이 받았던 요금의 2.5배 수준이다.
이로써 오픈AI는 불과 두 달 사이 연속으로, 주력 모델이 유료 이용자의 “성능이 약화됐다”는 지적을 받은 셈이 됐다. 7월에는 솔의 최상위 추론 모드가 “하룻밤 새 얄팍해졌다”는 주장이 나왔고, 당시 소티오는 의도적인 성능 하향은 부인했지만 추론 강도를 조절하는 실험을 하고 있었다는 사실은 인정했다.

