2.4조 파라미터로 맞붙은 Qwen3.8-Max vs GPT-5.6… 알리바바, 오픈AI 주력 모델 정면 겨냥

Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)
Pricing and benchmark pressure on OpenAI's GPT-5.6 builds as Alibaba's Qwen3.8-Max lands and Chinese models take 46% of U.S. enterprise tokens. (Image: Shutterstock)

알리바바의 2.4조 파라미터 Qwen3.8-Max가 이번 주 공개됐다. 미국 엔터프라이즈 시장에서 중국계 모델의 점유율이 토큰 기준 최대 46%까지 치솟으면서, 오픈AI의 GPT-5.6은 트래픽을 상당 부분 내주고 있는 모습이다.

핵심 포인트

  • 알리바바 Qwen3.8-Max는 총 2.4조 파라미터를 탑재했으며, 한 번의 요청마다 활성화되는 파라미터는 950억 개 수준이다. 모델 가중치는 다음 주 오픈소스로 공개될 예정이다.
  • 알리바바가 제시한 에이전트형 코딩 벤치마크에서는 여전히 GPT-5.6 Sol이 선두를 지키고 있지만, 격차는 미미하며 외부 검증은 아직 이뤄지지 않았다.
  • 중국계 모델의 물량 공세 속에 오픈AI는 7월 30일 최저가 요금제를 출시 3주 만에 80% 인하했다.

Qwen3.8-Max, GPT-5.6 Sol에 정면 도전

알리바바는 8월 3일, 2.4조 파라미터를 담은 Mixture-of-Experts(전문가 혼합) 구조의 Qwen3.8-Max를 공개했다. 전체 파라미터 규모는 초거대지만, 실제 요청당 활성화되는 파라미터 수는 950억 개로 설계해 계산 효율을 높인 구조다.

회사 측은 이번 플래그십 모델과 270억 파라미터급 소형 버전의 오픈 가중치를 다음 주 주요 공개 저장소에 올리겠다고 밝혔다. 그간 최상위 라인업은 폐쇄형으로 운영해 왔던 기조를 되돌리는 결정이다. 알리바바는 동시에 전체 벤치마크 결과표도 공개했다.

공개된 수치를 보면, Qwen3.8-Max는 에이전트형 코딩 역량을 가늠하는 Terminal-Bench 2.1에서 86.6점을 기록했다. 같은 지표에서 오픈AI GPT-5.6 Sol은 88.8점으로 여전히 선두지만, 격차는 2포인트 남짓이다. SWE-bench Pro에서는 Qwen3.8-Max가 67.7점, Anthropic의 Claude Fable 5는 80.0점으로 차이가 났다. 반면, 실제 컴퓨터 사용 능력을 시험하는 OSWorld-Verified에서는 Qwen3.8-Max가 86.1점을 기록해 Sol(83.2점)을 상회했다고 주장했다.

다만 이 같은 수치는 아직 독립적인 외부 연구소에서 재현되지 않았다. 알리바바는 Qwen3.8-Max가 16일간 사람 개입 없이 명령줄 도구를 설계·구현했다고 설명한다. 유저 요청을 코드로 변환하고, 자체 테스트까지 수행했다는 시연이다. 하지만 개발자 커뮤니티에서는 해당 데모와 라이선스 조건을 놓고 의문을 제기하고 있다.

함께 읽기: 아이폰 18 Pro Max, 애플 첫 2nm 칩 탑재로 15% 성능 향상 전망

“격차 두세 달로 축소”… 이온 스토이카가 보는 중국의 추격

이온 스토이카(Ion Stoica) 캘리포니아대 버클리 교수이자 Arena 벤치마크 플랫폼 공동 창립자는 7월 말, 중국계 오픈 가중치 모델이 미국 최전선 연구소 모델과의 격차를 “현재 2~3개월 수준”으로 평가했다. 불과 이전까지는 6~9개월 격차가 난다고 진단했으나, 지난 1년간 DeepSeekZ.ai의 GLM 라인이 잇따라 개방형 모델을 내놓으면서 시각을 수정한 것이다.

Vercel에서 에이전트 인프라를 총괄하는 **하르프리트 아로라(Harpreet Arora)**는 “지금은 가격이 모든 것을 말해준다”며 “엔지니어링 팀들은 기준 성능만 넘으면 가장 저렴한 모델로 트래픽을 돌리고 있다”고 설명했다. OpenRouter저스틴 서머빌(Justin Summerville) 역시 중국계 공개 모델이 60~90% 수준까지 더 저렴하다고 분석했다. 라우팅 전략은 결국 비용 구조를 따라간다는 뜻이다.

GPT-5.6, 가격 인하로 ‘볼륨 구간’ 수성 나서

오픈AI는 GPT-5.6 패밀리 출시 3주 만인 7월 30일, 자사 블로그를 통해 Luna 티어 요금을 80% 인하했다. 인풋 토큰 100만 개당 0.20달러, 아웃풋 토큰 100만 개당 1.20달러 수준이다. 중간급 Terra 요금제도 20% 인하에 들어갔다. 반면 플래그십 Sol 요금은 인풋 100만 개당 5달러, 아웃풋 100만 개당 30달러로 그대로 유지됐다.

이 같은 가격 정책은 패밀리 최상단에는 프리미엄 가격대를 유지하면서, 아래 구간에서 중국계 모델과 ‘물량전’을 벌이겠다는 전략으로 읽힌다. 실제로 중국발 모델은 올해 들어 미국 시장에서 토큰 트래픽을 빠르게 잠식해 왔다.

한 대형 라우팅 플랫폼 기준, 중국계 모델은 2025년 상반기까지만 해도 미국 개발자 토큰 볼륨의 4.5% 수준에 그쳤다. 하지만 2026년 2월 이후에는 매주 30%를 상회하며, 최근에는 최대 46%까지 치솟았다. 스탠퍼드대학교 연구진이 정리한 보고서에 따르면, 2023년에는 미국 최상위 모델이 경쟁 모델을 벤치마크에서 최대 31.6%포인트 앞섰지만, 2026년 3월에는 그 격차가 2.7%로 줄었다.

다음 읽기: 비트코인, 극단적 공포를 7만5천 달러 랠리의 연료로 바꿀 수 있을까

Alexey Bondarev profile photo

Alexey Bondarev

Alexey Bondarev는 Yellow.com의 콘텐츠 책임자로, 지난 10년 동안 암호화폐 분야를 취재해 왔습니다. 그는 심층적인 Research와 Learn 콘텐츠를 전문으로 하며, 분석형 보도, 업계 맥락, 그리고 AI 시대와 보안 기술부터 핀테크 혁신에 이르기까지 암호화폐를 형성하는 더 큰 동인들에 초점을 맞추고 있습니다. 그는 모든 디지털이 곧 모든 아날로그를 앞지르게 될 것이라 믿으며, 그것을 현실로 만들기 위해 꾸준히 노력하고 있습니다.

면책 조항 및 위험 경고: 이 기사에서 제공되는 정보는 교육 및 정보 제공 목적으로만 제공되며 저자의 의견을 바탕으로 합니다. 이는 재정, 투자, 법적 또는 세무 조언을 구성하지 않습니다. 암호화폐 자산은 매우 변동성이 크고 높은 위험에 노출되어 있으며, 여기에는 투자금 전부 또는 상당 부분을 잃을 위험이 포함됩니다. 암호화폐 자산의 거래나 보유는 모든 투자자에게 적합하지 않을 수 있습니다. 이 기사에 표현된 견해는 저자(들)의 견해일 뿐이며 Yellow, 창립자 또는 임원의 공식적인 정책이나 입장을 나타내지 않습니다. 투자 결정을 내리기 전에 항상 자신만의 철저한 조사(D.Y.O.R.)를 수행하고 면허를 가진 금융 전문가와 상담하십시오.