요금 가중치 공개 2026-08-17

DeepSeek 인상, 알리바바 2.4조 공개, GLM-5.3: 중국 LLM은 왜 8월에 진형을 바꿨나

누가 막혔나. DeepSeek·Qwen·GLM으로 에이전트를 돌리는 팀은 “1100% 인상”, “플래그십 가중치”, “같은 기반으로 급등” 세 헤드라인을 동시에 받고 청구와 라이선스 口径이 어긋납니다. 결론. 국산 모델은 가격 경쟁에서 가격 결정권 경쟁으로 옮기고 있습니다. 구성. 함정 3개, 2주 타임라인, 수치표 3장, 횡비교, 미검증 주장, 격리 Mac 5단계, FAQ.

2026년 8월 DeepSeek 피크 인상, Qwen3.8-Max 가중치 공개, GLM-5.3 후훈련

8/3 GA는 Qwen3.8-Max 출시, Flash 평가는 V4 Flash 공식 평가, 미국 측 인하는 GPT-5.6 Luna 인하를 보세요.

8월 12일부터 17일까지 닷새, 중국 주요 랩은 모순처럼 보이는 세 수를 동시에 뒀습니다. DeepSeek는 일부 구간 API를 최대 1100% 넘게 올렸고, 알리바바는 한 번도 열지 않았던 Qwen-Max급 2.4조 파라미터 가중치를 풀었으며, 지푸는 같은 기반으로 후훈련만으로 코딩 점수를 수 배 끌어올린 GLM-5.3을 냈습니다. 세 회사, 세 수. 신호는 하나입니다. 국산 LLM은 “가격”이 아니라 “가격 결정권”을 겨루기 시작했습니다.

01 · 결정 함정 3개

  1. 1100% 헤드라인은 청구서가 아닙니다. 피크 캐시 히트 입력이 가장 많이 오른 이유는 원래 거의 공짜였기 때문입니다. 실제 청구를 지배하는 출력은 350%입니다.
  2. 가중치 공개는 Apache 2.0이 아닙니다. 최근 12개월 5000만 달러 초과 MaaS/AI 업무 도우미는 별도 상용 허가가 필요합니다. MAU 1억 또는 월수입 2000만 달러 초과는 모델명을 화면에 명시해야 합니다.
  3. “중국산=최저가”는 더 이상 안전한 가정이 아닙니다. 오프피크 V4-Pro는 Claude Opus 5보다 싸지만, 국제 Qwen3.8-Max와 GPT-5.6 Luna는 적어도 한 축에서 DeepSeek를 밑돕니다.

02 · 2주 타임라인

날짜 사건
7월 16일문샷 Kimi K3(2.8조) 가중치 공개. 이미 미측 안보 관심을 받음
8월 2–3일알리바바 Qwen3.8-Max 예고 후 클라우드 API 개시
8월 10일Meta Muse Glimmer(300억, Apache 2.0) 공개, 플래그십 Muse Spark 1.2 가중치 “곧 공개” 예고
8월 12일Qwen3.8-2.4T-A95B를 ModelScope/Hugging Face에 공개. 당일 xAI Grok 4.6
8월 13일DeepSeek-V4-Pro 정식판과 8월 17일 인상 발표. Google은 인하한 Gemini 3.7 Flash
8월 14일지푸 GLM-5.3. 기반은 GLM-5.2와 같은 7430억
8월 17일 0시(베이징)DeepSeek 신요금 발효

더 뒤로 당기면, 7월 30일 OpenAI는 최저 티어 GPT-5.6 Luna를 80% 내렸고, 8월 6–7일에는 무료 사용자 기본 모델로 두고 무제한 텍스트를 열었습니다. 중국이 인상과 공개를 더하는 같은 주에 미국은 무료와 인하를 더했습니다. 우연이 아니라 같은 가격 전쟁의 양면입니다.

03 · 핵심 수치

DeepSeek 인상 명세(8월 17일 0시~. 피크는 베이징 9–12시, 14–18시)

항목(백만 tokens) 이전 오프피크 피크 피크 증가
V4-Flash 캐시 히트 입력¥0.02¥0.05¥0.10약 400%
V4-Flash 미스 입력¥1.0¥1.5¥3.0200%
V4-Flash 출력¥2.0¥4.5¥9.0350%
V4-Pro 캐시 히트 입력¥0.025¥0.15¥0.30약 1100%
V4-Pro 미스 입력¥3.0¥4.5¥9.0200%
V4-Pro 출력¥6.0¥13.5¥27.0350%

공식 발표를 华尔街见闻, IT之家, V2EX로 교차 확인했습니다. 히트 입력 배율은 최대 약 12배/1100%+이지만 절대액은 작고, 헤비 사용자를 치는 쪽은 출력(350%)과 미스 입력입니다. 월 약 8400만 tokens, 대부분 오프피크, 히트 절반이면 청구 증가는 약 1.8배에 가깝습니다.

Qwen3.8-2.4T-A95B

항목 내용
규모총 2.4조, 활성 950억(MoE, 전문가 512, 라우팅 10+공유 1)
컨텍스트공개 가중치 원생 26.2만 tokens, 약 101만까지 확장. 클라우드 Max 기본 100만
일정8/2 예고 → 8/3 API → 8/12 가중치
국제 API입력 $2/M, 출력 $6/M
라이선스Apache 2.0 아님. 맞춤 Qwen3.8-Max License
의미알리바바 첫 Max급 플래그십 공개. Qwen3.5/3.6/3.7 Max는 API만

GLM-5.3: 기반 유지, 후훈련만

벤치 5.2 5.3 변화
Terminal-Bench 3.04.6%28.3%+23.7
DeepSWE v1.146.2%66.9%+20.7
Agents' Last Exam(CLI)23.8%28.5%+4.7
CyberGym77.2%84.5%+7.3
AutomationBench26.2%48.2%+22.0

지푸 자체 측정이며 제3자 재실행은 아직 없습니다. Terminal-Bench 3.0에서 GPT-5.6 Sol(34.6%), Claude Fable 5(33.7%)에 뒤처져 전면 1위가 아니라 공개 가중치 1군입니다.

04 · 세 가지 수

DeepSeek: 시간대 요금은 연산 부족의 가시화

“드디어 마진에 굴복했다”는 읽기는 쉽지만, 구조는 연산 제약을 요금표에 처음으로 드러낸 쪽에 가깝습니다. 전일 저가는 고객 확보에는 먹혔으나 호출이 지수 성장하고 GPU가 못 따라가면 버틸 수 없습니다. 공문의 “더 유연한 워크로드 스케줄링을 권장”은 “피크 연산이 부족하니 부하를 옮겨 달라”는 번역입니다.

피크 공식 API는 GMI Cloud, Novita 등 일부 재판매보다 비싸졌습니다. “공식=항상 최저” 가정은 처음 깨졌습니다.

알리바바: 가중치로 생태계, 맞춤 라이선스로 천장

2.4조 체크포인트는 내려받을 수 있지만 라이선스는 기존 Apache 2.0이 아닙니다. 연매출 5000만 달러 초과 MaaS/AI 업무 도우미는 별도 협상, MAU 1억 또는 월수입 2000만 달러 초과는 모델명 표시가 필요합니다. 완전 Apache 2.0인 Muse Glimmer와 “공개”의 무게가 다릅니다.

미·EU·영·한 다운로드 금지 루머는 거짓입니다. 공개 조문에 지역 조항이 없습니다. 발표 스레드보다 LICENSE 파일을 먼저 여는 편이 빠릅니다.

지푸: 기반은 그대로, 후훈련 레시피만 교체

기반은 GLM-5.2와 같은 7430억이고 재사전학습은 없습니다. 강화학습 환경만 키워 Terminal-Bench 3.0을 4.6%에서 28.3%로, 약 6배 올렸습니다. 사전학습 Scaling Law 한계수익이 둔해진 뒤, 후훈련 RL 규모화는 천억급 기반을 다시 만드는 것보다 낮은 비용 바닥의 레버입니다.

05 · 여전히 최저가 플래그십인가

모델 입력/백만 출력/백만 가중치
V4-Pro(피크)¥9.0(약 $1.26)¥27.0(약 $3.78)비공개
V4-Pro(오프피크)¥4.5(약 $0.63)¥13.5(약 $1.89)비공개
Qwen3.8-Max(국제)$2$6공개(맞춤 라이선스)
GPT-5.6 Luna$0.20$1.20비공개
Claude Opus 5(알리바바 배수 추산)약 $5약 $25비공개

환율은 약 ¥7.15/$1입니다. 오프피크 V4-Pro는 Opus 5보다 싸지만 전장 최저가는 아닙니다. 국제 Qwen3.8-Max와 Luna가 오프피크 DeepSeek를 밑돕니다. 2025~2026초의 “중국산=최저가”는 계층 경쟁으로 바뀌었습니다.

06 · 미검증 주장

  • 1100%는 피크 캐시 히트 입력만입니다. 출력은 350%. 매체마다 인용 칸이 다릅니다.
  • 진오 M890/반고 AL128에서 일부 추론이 돈다는 중문 경제지 전언은 공식 기술 문서·제3자 벤치 미확인입니다. 독립 검증 없음으로 표시하세요.
  • GLM-5.3이 Cursor 심각 취약점을 발견했다는 말은 VentureBeat와 지푸 측 공개이며 세부 미공개입니다. 벤더 단독 주장입니다.
  • 중국 상무부가 AI/반도체 보복 수출통제를 검토한다는 보도는 공식 확인이 없습니다. 배경으로만 두세요.

07 · 두 전선의 가격 전쟁

지난 한 달 중국 쪽은 “주 3갱신”이라 불릴 밀도로 냈습니다. DeepSeek, 알리바바, 지푸에 더해 7월 16일 Kimi K3(2.8조 공개)와 MiniMax H3가 이어집니다. 국내 경제 매체는 “중국 공개 가중치가 세계 재가격을 압박한다”고 프레임합니다.

미국은 소비층에서 반대로 달립니다. OpenAI는 7월 30일 Luna 80% 인하, 다음 주 무료 기본·무제한 텍스트, Google은 8월 13일 3주 전 모델의 반값 Gemini 3.7 Flash. 중국은 플래그십 공개와 상위 단계 인상, 미국은 무료와 저가 방어. 둘 다 진짜 전략이고 깔때기의 다른 층을 최적화합니다.

지정학 층도 조심히 적습니다. Kimi K3 공개는 이미 미측 심사 관심을 불렀고, 알리바바가 이 창에서 2.4조를 연 것은 “규제가 조이기 전에 국제 존재감과 기술 대등 서사를 고정한다”는 해석이 있습니다. 확정 사실이 아니라, 영어권 제품 뉴스만 보면 안 보이는 맥락입니다.

08 · 격리 Mac 5단계

회사 키가 있는 노트북에서 요금 실험을 하지 마세요. 버릴 수 있는 Apple Silicon 노드에서 다음 순서로 가세요.

  1. 피크 창을 피합니다. 배치 가능한 호출을 베이징 9–12시, 14–18시 밖으로 옮기고, 최근 30일이 “약 1.8배”인지 headline 1100%인지 추정합니다.
  2. 라이선스 문턱을 확인합니다. 연매출 5000만 달러, MAU 1억, 월수입 2000만 달러 세 선을 걷습니다. 개인·내부는 대개 괜찮지만 “내려진다=추론 재판매 가능”은 아닙니다.
  3. 같은 과제로 잽니다. V4-Pro, Qwen3.8-Max, GLM-5.3을 동일 코딩/CLI 에이전트 과제로 비교하고 적중률·출력 비중·완료 단가를 남깁니다.
  4. 격리 Mac에서 시범합니다. M 시리즈 요금 안내에서 일 단위 노드를 고르고, 키와 평가 로그를 일상 기기 키체인에서 뺍니다.
  5. 검증 후 폐기합니다. 비용 모델과 오프피크 cron을 내보낸 뒤 임대를 폐기합니다.
# 베이징 피크 09:00-12:00 / 14:00-18:00 회피 export TZ=Asia/Shanghai mkdir -p ~/llm-cost/{logs,prompts,reports} crontab -l

09 · FAQ

인상 후 무조건 비싸지나요?
오프피크이고 적중률이 높은 헤비 사용자는 headline보다 낮아 약 1.8배라는 추산이 있습니다. 피크이고 적중률이 낮으면 headline에 가까워집니다.

개인이 Qwen3.8-Max를 무료 상용할 수 있나요?
개인·내부는 대체로 영향이 없습니다. MaaS 또는 AI 업무 도우미로 최근 12개월 해당 사업 수입이 5000만 달러를 넘으면 별도 허가, MAU 1억 또는 월수입 2000만 달러 초과면 화면 표시가 필요합니다.

GLM-5.3과 5.2는 같나요?
기반은 동일(7430억)이고 재학습은 없습니다. 점수는 후훈련 강화학습 환경 확대입니다.

미·EU 다운로드 금지는 사실인가요?
아닙니다. 공개 조문에 지역 제한이 없고, 제한은 매출 규모에 묶입니다.

Muse Glimmer는 플래그십 개방인가요?
부분 회귀입니다. Glimmer는 300억 증류 모델이고 Muse Spark 1.2는 미공개입니다. 저커버그는 “곧”이라고만 예고했습니다.

10 · 왜 일상 기기나 범용 클라우드가 아니라 Mac을 빌리나

개인 노트북에서 키를 바꾸거나 Windows/Linux 클라우드에서 한 번 구워 비교할 수는 있습니다. 버릴 스크립트에는 충분합니다. 남길 비용 모델에는 맞지 않습니다. 회사 비밀과 평가 키가 같은 키체인에 섞이고, 피크 오발동이 월 예산을 태우며, 범용 이미지는 macOS/Apple Silicon 사이드카와 어긋납니다. 재현 가능한 결론, 일 단위 과금, 실제 Apple 하드웨어가 필요하면 격리 Mac이 더 깨끗한 실험실입니다. 일주일 요금 실험 때문에 본체를 살 필요는 없습니다. 요금 안내M4 계산 노드 주문을 보세요.

11 · 출처

  • DeepSeek 공식 요금 발표(华尔街见闻, IT之家, AIGC.cn, V2EX 교차)
  • 알리바바 공식 Qwen 저장소(Hugging Face/ModelScope)와 SCMP 라이선스 보도
  • 지푸(Z.ai) GLM-5.3 공식 페이지, VentureBeat, StableLearn
  • Meta AI Research 공식 블로그와 VentureBeat Muse Glimmer 보도
  • 第一财经, 搜狐财经 등 중국 측 공개 밀도 종합 보도

가격·라이선스·지표는 공개 시점 정보입니다. 재게시 전 공식을 다시 확인하세요. 칩, 취약점, 수출통제 전언은 독립 확인되지 않았습니다. 출처: 데스크톱 『중국대모형开源涨价潮-博客文章-中英双语.md』.