중국 LLM 2026 GA 2026-08-04

알리바바 Qwen3.8-Max 정식 출시:2.4조 파라미터 Arena 5위, 다음 주 오픈 웨이트 예정

대상 독자: Qwen3.8-Max·Kimi K3·DeepSeek V4 연속 출시 속에서 벤치마크 신뢰도와 오픈 웨이트 일정을 판단해야 하는 Mac 개발자·AI Agent 팀.본문 제공: 8월 3일 GA 기준 타임라인, 핵심 스펙 표, 경쟁 모델 매트릭스, 「Open-Source」 라벨 선행 논쟁 해설.구성: 페인×3·비교표·아키텍처 분석·Mac 격리 5단계·FAQ×5·임대 CTA.

알리바바 Qwen3.8-Max 2026년 8월 3일 정식 출시 Arena 텍스트 랭킹 5위

Kimi K3 오픈 웨이트 전망은 Kimi K3 오픈 웨이트 공개 해설을, GPT-5.6 가격 인하 맥락은 OpenAI API 인하 분석을 참고하세요.

2026년 8월 3일, 알리바바가 차세대 플래그십 모델 Qwen3.8-Max를 정식 GA로 공개했습니다. 총 파라미터 2.4조, 활성 950B, Agent 제품 「千问办公(첸원 오피스)」 동시 론칭. Arena 텍스트 상위 8위 중 Qwen3.8-Max만이 Anthropic 이외 모델로 진입했지만, 현재 공개된 벤치마크는 대부분 자체 측정치이며 서드파티 정식 재현은 아직 없습니다.

01 · 선정 시 3대 페인포인트: 벤치마크만으로는 부족한 이유

  1. 「Open-Source」 라벨은 붙었지만 가중치는 미공개: qwen.ai는 GA 당일 오픈소스 표기를 달았으나, Hugging Face·ModelScope에 저장소·라이선스·확정 일정이 없고 「다음 주」 수준의 모호한 약속만 존재합니다. 마케팅 리듬이 검증 가능한 산출물보다 앞섰다는 비판이 이어집니다.
  2. 벤치마크가 전부 자체 프레임워크 기준: PaperBench, QwenSWEBench, RecreationBench 등은 내부 벤치가 많고, Artificial Analysis·Arena.ai 등 중립 플랫폼의 정식판 독립 재현은 아직 없습니다. Arena 1496점은 「Preliminary(예비)」 표기입니다.
  3. 프리뷰 단계 투명성 부족이 신뢰 부채로: 7월 19일 프리뷰는 활성 파라미터·벤치 표 미공개, 자동화 프로덕션 호출 금지 조항이 있었습니다. GA에서야 950B 활성 파라미터가 공개됐고, 독립 평가 기관은 「자체 업무에서 먼저 테스트하라」고 권고했습니다.

02 · 타임라인: 프리뷰에서 GA까지 2주 압축

  • 7월 16일: Moonshot AI Kimi K3 발표 — 2.8조 파라미터(896 전문가 중 16개 활성), 독립 평가·기술 보고서 강조.
  • 7월 19일: Qwen3.8-Max 프리뷰 오픈 — Token Plan / Qoder / QoderWork 연동, 정식가 10% 요금, 활성 파라미터·벤치 미공개.
  • 7월 27일: Kimi K3 가중치 Hugging Face 공개, 어텐션 커널·MoE 통신 라이브러리 등 Infra 동시 오픈.
  • 7월 31일: DeepSeek V4-Flash 정식판 — 파라미터 규모 동일, Agent·코드 벤치에서 V4-Pro 프리뷰 대비 대폭 상승.
  • 8월 3일: Qwen3.8-Max GA, 전체 벤치 표 공개, 「千问办公」 동시 출시. 알리바바 홍콩 주가 약 7%, 미국 ADR 약 4.5% 상승.
  • 8월 10일 전후(예상): Qwen3.8-Max 및 경량판 Qwen3.8-27B 가중치 Hugging Face·ModelScope 업로드 예정, 라이선스 조항은 미공개.

03 · 핵심 스펙 한눈에

항목 Qwen3.8-Max
출시일2026년 8월 3일 (GA)
총 / 활성 파라미터2.4조 / 950B
아키텍처Qwen3.5 기반 희소 MoE + 혼합 어텐션
컨텍스트100만 토큰(사고 모드 약 98.3만, 출력 상한 13.1만)
API 요금입력 $2/M 토큰, 출력 $6/M 토큰
중국 내 요금입력 12위안/M, 출력 36위안/M, 캐시 히트 1.5위안
Arena 텍스트 (8/1 스냅샷)5위, 1496점 (Preliminary)
Arena 비전2위, Claude Fable 5에 이어
PaperBench (자체)93.0 (전세대 대비 +28.2)
SWE-bench Pro (자체)67.7 (Fable 5 80.0 대비 열위)
가중치 공개「다음 주」 약속, 현재 미공개

핵심 데이터 #1: API 입력 $2/M·출력 $6/M — Claude Opus 5($5/$25), Claude Fable 5($10/$50) 대비 현저히 저렴합니다.

핵심 데이터 #2: Arena 텍스트 제 51496점, 상위 8위 중 유일한 비-Anthropic 모델이나 「예비」 등급입니다.

핵심 데이터 #3: 출시일 알리바바 홍콩 주가 약 7%·미국 ADR 약 4.5% 상승 — 시장이 AI 서사 회복으로 해석했습니다.

04 · 심층 분석: 2.4조 파라미터 뒤에 있는 전략

4.1 MoE + 혼합 어텐션을 택한 이유

희소 MoE는 총 파라미터 2.4조를 유지하면서 실제 활성을 950B로 제한합니다. 추론 비용은 진짜 2.4조를 매번 호출하는 것이 아니라 천억급 모델에 가깝습니다. 단순 스케일 업이 아니라 아키텍처 효율로 가격 경쟁력을 확보한 설계입니다.

4.2 reasoning_effort 3단계

low / medium / xhigh(기본값) 세 단계로 추론 강도를 조절합니다. enable_thinking 파라미터 또는 Anthropic 호환 reasoning.effort 필드로 호출할 수 있어, 작업 복잡도에 따라 속도와 깊이를 트레이드오프할 수 있습니다.

4.3 장기 자율 작업과 생태계 포지셔닝

알리바바 사례에는 16일간 무인 개발 프로젝트, 500단계 이상 칩 설계 최적화, RecreationBench 기반 앱 블랙박스 복원 등이 포함됩니다. API는 OpenAI·Anthropic 프로토콜을 동시 지원해 Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw 등 주류 Agent 체인에 바로 연결 가능합니다.

05 · 경쟁 비교: Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

모델 총/활성 요금(입/출, M당) 가중치 서드파티 평가
Qwen3.8-Max2.4T / 950B$2 / $6미공개(약속 중)없음
Kimi K32.8T / 약 500B$3 / $15공개(7/27)AA Index ≈ 57.11
DeepSeek V4-FlashV4-Pro 동일전체 표 미공개공개Agent·코드 9항목 V4-Pro 초과
Claude Opus 5비공개$5 / $25폐쇄Arena 상위권
Claude Fable 5비공개$10 / $50폐쇄Arena 텍스트 1위

유일한 독립 블라인드 테스트(269개 파일 실제 아키텍처 설계): Kimi K3 83점, Qwen3.8-Max 프리뷰 80점 — 격차가 작아 「압도」보다 「호각 승부」에 가깝습니다.

06 · 논쟁: 오픈소스 라벨이 가중치보다 먼저 달렸다

  • 라벨만 Open-Source, 저장소는 공백: Hugging Face·ModelScope에 해당 리포·라이선스·확정 일정이 없습니다.
  • 벤치가 전부 자체 프레임워크: QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench 등 내부 기준 다수.
  • 각주가 경쟁사 데이터를 의심: 「Fable 5 결과에 fallback 가능성」이라 적었으나, 알리바바 자체 방법론도 서드파티 재현 수준까지 공개되지 않았습니다.
  • 프리뷰 투명성 부족: 7월 19일 프리뷰는 프로덕션 자동화 호출 금지, model card·안전 평가 보고서 미제공.

이는 Qwen3.8-Max 성능이 나쁘다는 뜻은 아닙니다. 유일한 독립 블라인드 테스트 기준 Kimi K3와 동급입니다. 다만 「글로벌 1티어 진입」 결론은 아직 알리바바 측 주장 비중이 크므로, 가중치 공개와 서드파티 벤치가 나온 뒤 재검증이 필요합니다.

07 · 업계 영향: 조 파라미터 경쟁의 새 국면

  • 2026년은 조 파라미터 「양산」의 해: DeepSeek V4-Pro(1.6T) → Qwen3.8-Max(2.4T) → Kimi K3(2.8T). 그러나 DeepSeek V4-Flash는 파라미터 불변으로 Agent 능력을 크게 끌어올려 「효율 경쟁」 서사가 부상 중입니다.
  • 알리바바의 드문 「오픈 회귀」: 이전 Max급은 폐쇄였으나 이번엔 Max 가중치 공개를 약속 — Kimi K3·DeepSeek와 함께 중국 상위권이 오픈 웨이트로 수렴하는 흐름입니다.
  • Qwen이 Apple Intelligence에 내장: 4GB 이하로 압축된 Qwen이 iPhone 15+ 온디바이스 실행 — 수억 대 iPhone이 시스템 AI 채널이 됩니다.
  • 미중 AI 내러티브 대비: Qwen3.8-Max 출시 전후 OpenAI·Anthropic이 Agent 탈옥·기업 시스템 침입 사례를 공개했고, 백악관은 8월 4일 자발적 사이버보안 테스트 프레임워크를 논의 — 한쪽은 오픈 생태계 선점, 다른 쪽은 Agent 규제 강화입니다.

08 · Mac 격리 5단계 시범 운영 (Agent 체인 검수)

  1. QwenCloud에서 API Key 발급 후 OpenAI·Anthropic 호환 SDK로 기준 작업 3종(장문 요약 / 버그 수정 / 다중 파일 리팩터) 실행, xhigh vs low 지연 시간 기록
  2. 격리 환경에 ANTHROPIC_BASE_URL 또는 OpenAI 호환 엔드포인트 설정, Claude Code / OpenClaw / Qoder CLI 연결 — API Key를 주력 Mac 전역 shell에 두지 않기
  3. Kimi K3·DeepSeek V4-Flash와 동일 269파일급 아키텍처 작업을 병렬 실행, 블라인드 채점·$/task 청구서 대조
  4. Hugging Face / ModelScope에서 Qwen3.8-Max·Qwen3.8-27B 리포·LICENSE 업로드 시점 모니터링, 가중치 확보 후 Ollama 로컬 배포 가능성 재평가
  5. Kimi K3 해설과 본문 비교표를 팀 선정 문서로 정리, 8월 10일 전후 재검증 일정 설정
# Anthropic 호환 엔드포인트 (격리 환경) export ANTHROPIC_BASE_URL="https://dashscope.aliyuncs.com/compatible-mode/v1" export ANTHROPIC_API_KEY="your-qwen-api-key" claude -p "Summarize Qwen3.8-Max GA release on August 3, 2026."

09 · FAQ

Q1: Qwen3.8-Max는 지금 바로 쓸 수 있나요? 오픈소스인가요?
A: API는 QwenCloud에서 OpenAI·Anthropic 호환으로 즉시 호출 가능합니다. 가중치는 아직 없으며 8월 10일 전후 Hugging Face·ModelScope 업로드가 예상됩니다.

Q2: Qwen3.8-Max와 Kimi K3 중 어느 쪽이 더 강한가요?
A: 권위 있는 단일 벤치는 없습니다. 독립 블라인드 테스트에서 Kimi K3 83점, Qwen3.8-Max 프리뷰 80점. Kimi K3는 오픈 웨이트·서드파티 평가, Qwen3.8-Max는 API 가격·멀티모달이 강점입니다.

Q3: 2.4조 파라미터면 일반 개발자가 쓸 수 없나요?
A: 활성 950B이며 API 비용은 천억급에 가깝습니다. 전체 온프레미스는 다중 노드가 필요하므로 Qwen3.8-27B 경량판 오픈 웨이트를 기다리는 편이 현실적입니다.

Q4: 알리바바 벤치마크를 믿어도 되나요?
A: 참고용으로는 유용하나 결론으로는 이릅니다. 대부분 자체 프레임워크 기준이므로 독립 재현 또는 자체 A/B 테스트를 병행하세요.

Q5: 일반 사용자에게 어떤 영향이 있나요?
A: 중국 Apple Intelligence는 압축 Qwen을 iPhone 15+에서 온디바이스 실행합니다. 국내 iPhone 사용자도 시스템 레벨 Qwen 기능을 접할 가능성이 큽니다.

10 · Mac 임대로 탄력 검증: 주력기 밖에서 Qwen3.8-Max Agent 시험

Qwen3.8-Max API가 OpenAI / Anthropic 이중 프로토콜을 지원해도 주력 개발 Mac에서 Agent 체인을 바로 갈아타면 위험이 있습니다. API Key가 전역 환경에 오염되고, 100만 토큰 실험이 로컬 캐시를 비가역적으로 점유하며, Claude Code / OpenClaw 공존 설정은 롤백이 어렵습니다. Windows·Linux에서도 클라우드 API 호출은 가능하지만 Xcode·Keychain과 공존하는 macOS 네이티브 Agent 워크플로는 재현하기 어렵습니다.

노트북에서 단기 API 검증은 충분히 합리적입니다. 다만 주력기는 안정적 배송용으로 두고, Windows나 구형 Intel Mac에서 원격 시험하면 지연 오판·인증서 체인·로컬 Ollama 병행 시나리오를 완전히 검증하기 어렵습니다. 일 단위 과금·격리 환경·실제 Apple Silicon이 필요하다면 MacDate 임대로 가중치 공개 전 Agent 체인 대조 실험을 저비용으로 마칠 수 있습니다. 요금은 M 시리즈 Mac 연산 임대 요금을 참고하세요.

단기 클라우드 API로 선정 검증은 현명한 선택입니다. 재현 가능한 Agent 환경·완전한 Apple 생태계 호환·Key 유출 위험 최소화가 필요하면 Mac mini M4 일 단위 임대가 더 나은 균형이며, 선정 실패 비용을 줄여 줍니다.

11 · 출처

  • 알리바바 공식 블로그·보도자료 (Qwen3.8-Max GA·요금 페이지)
  • Alibaba Cloud Community, Alibaba Press Room 영문 공지
  • Arena.ai 텍스트·비전 랭킹 (2026년 8월 1일 스냅샷)
  • 국내외 미디어: 월계, 대모델지가, ITBear, 신랑재경 등
  • 독립 분석: Apidog, Yotta Labs, eesel AI, Context Studios, MarkTechPost, TechNode, SiliconANGLE
  • Apple Intelligence 관련: TechCrunch, Memeburn, Digital Market Reports

게시 전 최신 공식 공지·오픈 일정·벤치 수치를 반드시 재확인하세요. 일부 수치는 후속 업데이트로 변동될 수 있습니다.