DeepSeek V4-Flash-0731 공식판: 284B 동일 구조·후학습만 갱신, Agent 벤치 V4-Pro 추월
대상 독자: DeepSeek API·Claude Code·OpenClaw로 Agent를 돌리는 Mac 개발자로, 「V4 정식판」이 새 모델인지·가격·벤치 신뢰도를 구분해야 하는 팀.본문 제공: 7월 31일 API 공식판 타임라인, 핵심 요금·스펙 표, CSA/HCA/mHC 아키텍처, Kimi K3·Qwen3.8·Claude 비교, Harness 논쟁, 업계 영향.구성: 페인×3·비교표·Mac 격리 5단계·FAQ×5·Mac 임대 CTA.
📋 목차
V4 GA·피크 요금 맥락은 DeepSeek V4 GA 정식판 분석, Kimi K3·Qwen3.8 연속 출시는 Kimi K3 오픈 웨이트·Qwen3.8-Max GA를 참고하세요.
2026년 7월 31일, DeepSeek이 V4-Flash-0731을 API 공식판(빌드 태그 0731)으로 승격했습니다. 파라미터는 4월 프리뷰와 동일한 284B 총 / 13B 활성 — 새 모델이 아니라 후학습만 다시 돌린 업데이트입니다. 그런데 Agent 벤치에서는 자사 1.6T급 V4-Pro 프리뷰(67.9)를 82.7로 넘겼고, Claude Opus 4.8 대비 토큰 단가는 캐시 미스 입력 약 36배·캐시 히트 약 179배·출력 약 89배 저렴하다는 보도가 나왔습니다. 플래그십 V4-Pro 공식판과 자체 Agent 프레임워크 Harness는 여전히 「곧 출시」 상태이며, 이번 갱신은 API 전용 — App·웹 채팅은 아직 동기화되지 않았습니다.
01 · 선정 시 3대 페인포인트: 「정식판」이라고 해서 새 모델은 아님
- 마케팅과 실제 산출물의 간극: 「DeepSeek V4 정식판」 뉴스만 보면 1.6T Pro가 나온 것처럼 읽히지만, 7월 31일 실제 GA는 Flash만 해당합니다. V4-Pro 공식판·Harness는 changelog에 이름만 등장하고 공개 일정은 없습니다. 7월 중순 Pro 전량 GA 기대가 빗나가자 중국 커뮤니티는 창업자를 「梁白开(공약)」로 놀렸다가, Flash 성능이 기대를 넘기며 다시 「梁圣」로 돌아섰습니다 — 감정이 선정 지표보다 빠르게 흔들리는 사례입니다.
- 벤치 숫자와 실사용 체감의 괴리: Terminal Bench 2.0 82.7 등 Agent 점수는 미공개 Harness minimal mode(max·top_p 0.95·temperature 1.0)로 측정된 벤더 자체 수치입니다. 공식 changelog도 harness 선택에 「매우 민감」하다고 경고합니다. 해외 개발자 커뮤니티 피드백(21세기경제보 전언)에는 입력 캐시 히트율 저조·안전 분류기 타임아웃 등이 보고되어, 「점수 폭등」과 실무 불안정이 동시에 존재합니다.
- 가격 전쟁 속 API·Agent 환경 오염: Kimi K3(7/27)·Qwen3.8-Max(8/3)·GPT-5.6 Luna -80%(7/30)가 겹치며 모델명·엔드포인트·Keychain 설정이 주력 Mac에 겹쳐 쌓입니다.
deepseek-chat·deepseek-reasoner는 7월 24일에 이미 중단되었고, Flash 공식판 전환을 놓치면 파이프라인이 조용히 실패합니다. Agent 체인을 주력기에서 바꾸면 API Key 유출·100만 토큰 실험의 캐시 오염·롤백 불가 설정이 뒤따릅니다.
02 · 타임라인: 4월 프리뷰에서 7월 Flash 공식판까지
- 2026년 4월 24일: DeepSeek-V4 프리뷰·오픈 웨이트(MIT) — V4-Pro(1.6T/49B 활성)와 V4-Flash(284B/13B 활성), 둘 다 100만 토큰 컨텍스트.
- 2026년 7월 24일: 레거시 모델명
deepseek-chat·deepseek-reasoner영구 중단, 전 트래픽 V4 계열로 전환. - 2026년 7월 27일: Moonshot AI Kimi K3(2.8T) 가중치 Hugging Face 공개 — Flash 공식판 직전 최대 규모 오픈 웨이트 중 하나로 압박.
- 2026년 7월 31일: V4-Flash-0731 API 공식 베타·Hugging Face 동기 오픈. changelog에 DeepSeek Harness 최초 명시(「곧 출시」). API만 갱신, App·웹 미동기화.
- 2026년 8월 2일: 알리바바 Qwen3.8-Max API GA — 중국 오픈 LLM 출시가 하루 간격으로 겹침.
- 2026년 8월 5일(본문 작성 시): V4-Pro 공식판은 여전히 「가능한 한 빨리」만 공식 확인. 국내 매체의 7월 28일 주 내부 테스트·8월 10–20일 GA 창은 미검증 보도 — 공식 일정으로 취급하지 마세요.
03 · 핵심 데이터 한눈에
| 모델 | 상태 | 총/활성 | 컨텍스트 | 입력(캐시 미스/히트, M당) | 출력(M당) | 라이선스 |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | 공식(7/31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | 프리뷰(4/24) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 가중치(7/27) | 2.8T / ~104B(추정) | ~1.05M | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| GLM-5.2 | 오픈(6월) | ~744B / ~40B | 1M | 본문 미검증 | 본문 미검증 | MIT |
| Qwen3.8-Max | API GA(8/2) | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 오픈 약속(가중치 대기) |
요금은 DeepSeek·Moonshot·알리 등 공식 공시(벤더 자보). DeepSeek는 향후 베이징 시간 평일 9–12시·14–18시 피크 2배 요금을 예고했지만 발효일은 아직 미공개입니다.
핵심 수치 3줄
- 82.7 vs 67.9 — Terminal Bench 2.0에서 V4-Flash-0731이 V4-Pro 프리뷰를 역전(벤더·Harness minimal mode 자체 측정).
- $0.03 / task — Artificial Analysis 독립 지수 기준 V4-Flash 작업당 비용; Kimi K3 $0.86·Claude Fable 5 $3.15 대비 극저가 포지션.
- 27% / 10% — V4-Pro 공식 기술 지표: 100만 토큰 컨텍스트에서 V3.2 대비 단일 토큰 FLOPs·KV Cache 점유(제3자 재현은 아직 제한적).
04 · 아키텍처·후학습: 「더 크게」가 아니라 「더 잘 학습」
4.1 구조 불변, 후학습만 교체
이번 업데이트의 핵심은 DeepSeek 공식 설명 그대로입니다: V4-Flash-0731은 4월 프리뷰와 파라미터 규모·모델 구조가 동일하고, 성능 향상은 후학습(post-training) 재실행에서만 발생했습니다. 284B/13B가 1.6T/49B급 Pro 프리뷰를 Agent 벤치에서 넘긴 사례는 2026년 하반기 트렌드를 보여 줍니다 — 파라미터 스케일만이 아니라 후학습 데이터·방법이 성능 격차를 좁히거나 뒤집는 시대.
4.2 CSA+HCA·mHC·Muon: 백만 토큰을 「쓸 수 있는」 비용으로
기술 보고서 《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》에 따르면 V4 시리즈 아키텍처 핵심은 다음 세 가지입니다.
- 혼합 어텐션(CSA+HCA): 압축 스파스·고압축 어텐션을 결합, 대외 명칭 DSA(DeepSeek Sparse Attention). 장문에서 연산·VRAM 절감 목적.
- mHC(流形 제약 하이퍼 연결): 기존 잔차 연결 구조 개선.
- Muon 옵티마이저: 수렴 속도·안정성 향상.
공식 수치: 100만 토큰 컨텍스트에서 V4-Pro는 V3.2 대비 단일 토큰 추론 FLOPs 27%, KV Cache 10%. 독립 제3자 전체 재현은 아직 드물지만, 사실이면 「백만 토큰」이 마케팅 숫자가 아니라 상용 비용 구조로 내려올 수 있다는 신호입니다.
4.3 Harness: Claude Code에 맞불, 아직 미공개
7월 31일 changelog가 DeepSeek Harness를 최초로 공식 명명했습니다. 파일 읽기·쓰기, 도구 호출, 명령 실행 등 엔지니어링 태스크용 자체 Agent 실행 프레임워크로, 지금까지 DeepSeek 팀도 Claude Code·OpenCode 등 서드파티 Agent에 의존했습니다. 공개 Agent 벤치(Terminal Bench 2.0, Toolathlon 등)는 전부 Harness minimal mode(미공개)로 측정 — max reasoning·top_p 0.95·temperature 1.0. changelog 원문: Agent 점수는 harness 선택에 극도로 민감하며 모델 순수 능력과 동일시하지 말라는 취지입니다.
05 · 경쟁 비교: 중국 오픈 LLM 「육각 전쟁」과 글로벌 가격선
| 모델 | 랩 | 출시/가중치 | 총 파라미터 | AA Intelligence Index | 작업당 비용(AA) |
|---|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 7/31 공식 | 284B | 50 | $0.03 |
| Kimi K3 | Moonshot | 7/16·7/27 | 2.8T | 57 | $0.86 |
| GLM-5.2 | Z.ai | 6월 | ~744B | Flash보다 약 +1 | 본문 미검증 |
| Qwen3.8-Max | 알리바바 | 8/2 GA | 2.4T | 본문 미검증 | 본문 미검증 |
| GPT-5.6 Sol | OpenAI | 폐쇄 | 비공개 | Flash +9pt 이상 | $1.86 |
| Claude Fable 5 | Anthropic | 폐쇄 | 비공개 | Flash +9pt 이상 | $3.15 |
AA Intelligence Index·작업당 비용은 Artificial Analysis(독립 벤치) 경유 재인용. DeepSeek Agent 벤치는 벤더·Harness 자체 측정 — 방법론이 다르므로 한 표에 합산 비교하지 않았습니다.
역설적 포지션: 독립 지수에서는 V4-Flash가 Kimi K3·GLM-5.2에 지능 점수로 뒤지지만, 작업당 비용은 Kimi의 약 1/29, GPT-5.6 Sol의 약 1/62, Claude Fable 5의 약 1/105. DeepSeek가 노리는 것은 「최고 지능」이 아니라 충분한 지능 + 극단적 가격 — OpenRouter 호출량 1위를 7주 연속 유지한 프리뷰 Flash의 연장선입니다. Agent·대량 배치에 지능 상한이 덜 중요한 사용자층을 겨냥합니다.
06 · 논쟁: 점수는 화려하지만 물음표도 많다
- Harness 의존 벤치: Terminal Bench 2.0 82.7은 미공개 Harness minimal mode 결과. Claude Code·Cursor 등으로 커뮤니티 재현 전에는 「특정 프레임워크 + 벤더 자보」로 분류하세요.
- 실사용 품질 이슈: 해외 개발자 피드백(21세기경제보 인용) — 입력 캐시 히트율 낮음, 안전 분류기 간헐 타임아웃. 「점수 폭등」과 운영 불안정이 공존.
- V4-Pro·Harness 일정 미확인: 「8월 10–20일 GA」 등은 미검증 보도. 공식 changelog는 「가능한 한 빨리」만 명시.
- 투자·IPO 루머: 약 74억 달러(약 5000억 원) 투자·487억 달러 밸류, 710억 달러 후속 라운드·IPO 준비 보도는 「据報」 수준 — 규제 공시·공식 확인 없음. 배경 정보만 참고.
07 · 업계 영향: 「斩杀线」과 칩株의 둔감 반응
중국 개발자 커뮤니티 용어 「斩杀线(참살선)」: DeepSeek의 「쓸 만한 성능 + 바닥 가격」 조합이 시장 문턱을 설정한다는 관점입니다. 성능이 Flash를 명확히 넘지 못하고 가격도 못 내리면 존재감을 잃는다 — GPT-5.6 Luna 80% 인하 등 동시기 가격 조정의 배경으로 읽힙니다. 21세기경제보 인용 업계 인사: 「모든 대모델 회사가梁文锋 앞에서 달려야 살아남는다.」
7월 31일 V4-Flash 공식화 당일 엔비디아·브로드컴·AMD 등 AI 칩株는 뚜렷한 하락 없이 마감 — 2025년 초 R1 발표 때 글로벌 AI 칩株 급락과 대비됩니다. 시장이 「DeepSeek식 효율」을 일회성 공포가 아니라 구조적 엔지니어링 내러티브로 받아들이는 단계로 보입니다.
Claude Opus 4.8 대비 가격(보도·벤더 자보)
- 캐시 미스 입력: Flash 약 36배 저렴
- 캐시 히트 입력: 약 179배 저렴
- 출력: 약 89배 저렴 — 지능 상한이 아닌 $/토큰 전쟁에서 Flash의 핵심 무기
08 · Mac 격리 5단계 시범 운영 (V4-Flash-0731 Agent 검증)
- DeepSeek API에서
deepseek-v4-flash로 기준 작업 3종(장문 요약·단일 파일 버그 수정·다중 파일 리팩터) 실행, 7월 24일 이전deepseek-chat호출이 없는지 로그 확인 - 격리 Mac에
OPENAI_BASE_URL=https://api.deepseek.com·OPENAI_API_KEY만 설정, Claude Code / OpenClaw 연결 — Key를 주력 Mac 전역 shell·Keychain에 두지 않기 - Kimi K3·Qwen3.8-Max API와 동일 작업·동일 프롬프트 병렬 실행, Artificial Analysis식 $/task·지연 시간·성공률 기록
- Harness minimal mode 벤치와 Claude Code 실측 차이를 문서화 — 공식 82.7을 내부 SLA에 그대로 쓰지 않기
- 검증 완료 후 격리 환경 폐기 또는 스냅샷 삭제, V4 GA 가이드의 피크 요금·Pro 전환 체크리스트로 팀 선정 문서 갱신
09 · FAQ
Q1: DeepSeek V4와 V3.2의 가장 큰 차이는?
A: 100만 토큰 컨텍스트 네이티브와 장문 비용 절감(FLOPs 27%·KV Cache 10% 공식 수치). Agent 최적화와 Claude Code·OpenCode 호환 강화.
Q2: 일상 사용은 Flash vs Pro?
A: 대화·단순·대량·Agent 파이프라인은 V4-Flash-0731. Agent 벤치로 Pro 프리뷰를 넘겼고 가격이 낮습니다. 깊은 추론·예산 여유는 Pro 프리뷰 후 공식판 재평가.
Q3: V4 Pro 공식판은 지금?
A: 8월 5일 현재 아니오. 공식 GA는 Flash API만. App·웹 미갱신. Pro·Harness는 「곧」만 공식, 8/10–20일은 미검증.
Q4: 공개 벤치를 믿어도 되나?
A: SWE-bench Verified 등 제3자 기준은 비교적 신뢰. Terminal Bench 2.0 등은 Harness 의존 — 독립 Agent 도구로 재현 후 결론.
Q5: 일반 개발자 실질 영향?
A: ChatCompletions·Anthropic 형식 API는 코드 변경 없이 deepseek-v4-flash가 새 공식판을 가리킵니다. deepseek-chat·deepseek-reasoner는 7/24 중단 — 즉시 새 모델명으로 전환.
10 · Mac 임대로 탄력 검증: Harness 전환 전 주력기를 지키기
V4-Flash-0731은 API 단가가 극저가지만, 주력 개발 Mac에서 Claude Code·OpenClaw·DeepSeek 엔드포인트를 동시에 바꾸면 위험이 큽니다. API Key가 ~/.zshrc·Keychain·IDE 설정에 겹쳐 쌓이고, 100만 토큰 장문 실험이 로컬 캐시·디스크를 비가역적으로 점유합니다. Harness 공개 전에는 벤치 숫자와 실측이 어긋날 수 있어, 주력기에서 「전면 전환」은 롤백 비용이 높습니다.
Windows·Linux에서도 API 호출은 가능하지만, Xcode·Keychain·Apple Silicon 로컬 양자화(Flash MIT 가중치) 시나리오는 macOS 네이티브 Agent 워크플로로만 완전 검증할 수 있습니다. 노트북 단기 테스트는 합리적이지만, Kimi K3·Qwen3.8과의 동일 작업 $/task 대조·Harness 민감도 실험은 격리된 Apple Silicon이 더 정확합니다.
일 단위 과금·클린 macOS·SSH 원격이 필요하면 MacDate 임대로 V4-Flash Agent 체인 시범을 저비용으로 마치고, 검증 후 환경 폐기로 Key 유출·설정 오염을 차단할 수 있습니다. 요금은 M 시리즈 Mac 연산 임대 요금을 참고하세요.
11 · 출처
- DeepSeek 공식 API 문서·changelog (api-docs.deepseek.com)
- 기술 보고서 《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》·Hugging Face 모델 카드
- Artificial Analysis 독립 벤치(경제 매체 경유 재인용)
- 21세기경제보 ·快科技(凤凰网) · V2EX 커뮤니티 논의
- Moonshot(Kimi K3)·Z.ai(GLM-5.2)·알리바바(Qwen3.8-Max) 공식 발표
게시 전 최신 요금·벤치·V4-Pro/Harness 출시 상태를 재확인하세요. 본문 데이터는 2026년 8월 5일 기준입니다.