알리바바의 2.4조 파라미터 Qwen3.8-Max가 이번 주 공개됐다. 미국 엔터프라이즈 시장에서 중국계 모델의 점유율이 토큰 기준 최대 46%까지 치솟으면서, 오픈AI의 GPT-5.6은 트래픽을 상당 부분 내주고 있는 모습이다.
핵심 포인트
- 알리바바 Qwen3.8-Max는 총 2.4조 파라미터를 탑재했으며, 한 번의 요청마다 활성화되는 파라미터는 950억 개 수준이다. 모델 가중치는 다음 주 오픈소스로 공개될 예정이다.
- 알리바바가 제시한 에이전트형 코딩 벤치마크에서는 여전히 GPT-5.6 Sol이 선두를 지키고 있지만, 격차는 미미하며 외부 검증은 아직 이뤄지지 않았다.
- 중국계 모델의 물량 공세 속에 오픈AI는 7월 30일 최저가 요금제를 출시 3주 만에 80% 인하했다.
Qwen3.8-Max, GPT-5.6 Sol에 정면 도전
알리바바는 8월 3일, 2.4조 파라미터를 담은 Mixture-of-Experts(전문가 혼합) 구조의 Qwen3.8-Max를 공개했다. 전체 파라미터 규모는 초거대지만, 실제 요청당 활성화되는 파라미터 수는 950억 개로 설계해 계산 효율을 높인 구조다.
회사 측은 이번 플래그십 모델과 270억 파라미터급 소형 버전의 오픈 가중치를 다음 주 주요 공개 저장소에 올리겠다고 밝혔다. 그간 최상위 라인업은 폐쇄형으로 운영해 왔던 기조를 되돌리는 결정이다. 알리바바는 동시에 전체 벤치마크 결과표도 공개했다.
공개된 수치를 보면, Qwen3.8-Max는 에이전트형 코딩 역량을 가늠하는 Terminal-Bench 2.1에서 86.6점을 기록했다. 같은 지표에서 오픈AI GPT-5.6 Sol은 88.8점으로 여전히 선두지만, 격차는 2포인트 남짓이다. SWE-bench Pro에서는 Qwen3.8-Max가 67.7점, Anthropic의 Claude Fable 5는 80.0점으로 차이가 났다. 반면, 실제 컴퓨터 사용 능력을 시험하는 OSWorld-Verified에서는 Qwen3.8-Max가 86.1점을 기록해 Sol(83.2점)을 상회했다고 주장했다.
다만 이 같은 수치는 아직 독립적인 외부 연구소에서 재현되지 않았다. 알리바바는 Qwen3.8-Max가 16일간 사람 개입 없이 명령줄 도구를 설계·구현했다고 설명한다. 유저 요청을 코드로 변환하고, 자체 테스트까지 수행했다는 시연이다. 하지만 개발자 커뮤니티에서는 해당 데모와 라이선스 조건을 놓고 의문을 제기하고 있다.
함께 읽기: 아이폰 18 Pro Max, 애플 첫 2nm 칩 탑재로 15% 성능 향상 전망
“격차 두세 달로 축소”… 이온 스토이카가 보는 중국의 추격
이온 스토이카(Ion Stoica) 캘리포니아대 버클리 교수이자 Arena 벤치마크 플랫폼 공동 창립자는 7월 말, 중국계 오픈 가중치 모델이 미국 최전선 연구소 모델과의 격차를 “현재 2~3개월 수준”으로 평가했다. 불과 이전까지는 6~9개월 격차가 난다고 진단했으나, 지난 1년간 DeepSeek과 Z.ai의 GLM 라인이 잇따라 개방형 모델을 내놓으면서 시각을 수정한 것이다.
Vercel에서 에이전트 인프라를 총괄하는 **하르프리트 아로라(Harpreet Arora)**는 “지금은 가격이 모든 것을 말해준다”며 “엔지니어링 팀들은 기준 성능만 넘으면 가장 저렴한 모델로 트래픽을 돌리고 있다”고 설명했다. OpenRouter의 저스틴 서머빌(Justin Summerville) 역시 중국계 공개 모델이 60~90% 수준까지 더 저렴하다고 분석했다. 라우팅 전략은 결국 비용 구조를 따라간다는 뜻이다.
GPT-5.6, 가격 인하로 ‘볼륨 구간’ 수성 나서
오픈AI는 GPT-5.6 패밀리 출시 3주 만인 7월 30일, 자사 블로그를 통해 Luna 티어 요금을 80% 인하했다. 인풋 토큰 100만 개당 0.20달러, 아웃풋 토큰 100만 개당 1.20달러 수준이다. 중간급 Terra 요금제도 20% 인하에 들어갔다. 반면 플래그십 Sol 요금은 인풋 100만 개당 5달러, 아웃풋 100만 개당 30달러로 그대로 유지됐다.
이 같은 가격 정책은 패밀리 최상단에는 프리미엄 가격대를 유지하면서, 아래 구간에서 중국계 모델과 ‘물량전’을 벌이겠다는 전략으로 읽힌다. 실제로 중국발 모델은 올해 들어 미국 시장에서 토큰 트래픽을 빠르게 잠식해 왔다.
한 대형 라우팅 플랫폼 기준, 중국계 모델은 2025년 상반기까지만 해도 미국 개발자 토큰 볼륨의 4.5% 수준에 그쳤다. 하지만 2026년 2월 이후에는 매주 30%를 상회하며, 최근에는 최대 46%까지 치솟았다. 스탠퍼드대학교 연구진이 정리한 보고서에 따르면, 2023년에는 미국 최상위 모델이 경쟁 모델을 벤치마크에서 최대 31.6%포인트 앞섰지만, 2026년 3월에는 그 격차가 2.7%로 줄었다.






