DeepSeek V4 GA 정식판 출시: 피크 요금·1.6T 아키텍처·GPT-5.6 비교
누구를 위한 글인가? Mac에서 deepseek-chat/reasoner로 코딩·Agent를 돌리는 개발자로, 7월 20일 GA와 7월 24일 구 API 종료에 맞춰 마이그레이션·비용 모델을 정리하려는 분입니다.얻는 것: 타임라인, CSA/HCA/mHC 해설, 벤치마크 표, 피크 요금표, 6단계 이전, 선정 매트릭스.구성: 스펙·가격 표, 코드 예제, FAQ×6, 격리 Mac 검증 제안.
📋 목차
횡단 비교는 GPT-5.6 Sol 벤치마크 해설, 로컬 추론은 V4-Flash Mac 로컬 추론, 가격 동향은 2026 AI 가격 인하 공략을 참고하세요.
3개월 프리뷰 끝에 DeepSeek V4 GA 정식판이 2026년 7월 20일 프로덕션에 올랐습니다. 4월 프리뷰 대비 Agent·수학·코드 역량이 강화됐고, 처음으로 피크·오프피크 차등 요금이 도입됐습니다. 「거의 무료」에서 규율 있는 상용 플랫폼으로 넘어선 전환점입니다. 본문은 아키텍처, 벤치마크, 요금, GPT-5.6·Claude Fable 5 비교, 7월 24일 API 마이그레이션을 Mac 개발자 실무 관점에서 정리합니다.
01 · 마이그레이션 3대 과제: GA ≠ 무료 교체
- 7월 24일 하드 데드라인:
deepseek-chat·deepseek-reasoner는 한국 시간 7월 25일 00:59(UTC 7월 24일 15:59)에 영구 중단됩니다. 프로덕션에 구 ID가 남아 있으면 주말 직후 서비스가 끊깁니다. 그레이스 기간이 아닌 즉시 차단입니다. - 피크 요금 청구 사각지대: 베이징 시간 평일 09:00–12:00·14:00–18:00 피크는 2배 요금. Agent 장시간 배치를 피크에 돌리면 프리뷰 시절 대비 월 청구가 2배까지 치솟을 수 있습니다. cron·캐시 설계가 없는 팀이 많습니다.
- Pro vs Flash 선정 혼선: reasoner는 Flash 사고 모드 또는 Pro로 이전. Think Max는 384K+ 컨텍스트 필요. 전면 Pro는 비용 상승, 전면 Flash는 SWE-bench급 품질 저하 위험. 용도별 라우팅이 필수입니다.
02 · 타임라인: 프리뷰에서 GA까지
| 날짜 | 이벤트 |
|---|---|
| 2026.4.24 | V4 프리뷰·MIT 오픈소스(V4-Pro 1.6T, V4-Flash 284B) |
| 2026.5 | 프로덕션 튜닝 버전·API 정식 제공 |
| 2026.6 | V4-Pro 출력가 75% 영구 인하($0.87/M tokens) |
| 2026.6.29 | 전 API 사용자에 GA(7월 중순)·피크 요금 이메일 공지 |
| 2026.7.19 | 일부 개발자 GA 그레이 테스트, 언론 익일 출시 보도 |
| 2026.7.20 | GA 정식 출시(본문 기준일) |
| 2026.7.24 | deepseek-chat / reasoner 영구 중단 |
03 · 기술 아키텍처
3.1 V4-Pro vs V4-Flash 스펙
| 항목 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조(1.6T) | 2840억(284B) |
| 토큰당 활성 | 490억(49B) | 130억(13B) |
| 레이어 | 61 | 43 |
| 컨텍스트 | 100만 tokens | 100만 tokens |
| 최대 출력 | 384K tokens | 384K tokens |
| 정밀도 | FP4(전문가)+FP8 | FP4+FP8 혼합 |
| 사전학습 | 33T+ tokens | 32T+ tokens |
| 라이선스 | MIT | MIT |
3.2 CSA + HCA 하이브리드 어텐션
기존 Transformer는 KV Cache 메모리가 컨텍스트에 비례해 증가해 100만 토큰이 사실상 불가능했습니다. V4는 V2/V3 MLA를 버리고 두 가지 새 어텐션을 결합합니다.
압축 희소 어텐션(CSA)
- Softmax 게이트 풀링으로 KV를 4배 압축
- FP4 Lightning Indexer로 top-k 선택(Pro top-1024, Flash top-512)
- 최근 128 토큰 슬라이딩 윈도우 유지
- 1M 컨텍스트에서 V3.2 대비 27% FLOPs
고압축 어텐션(HCA)
- 토큰을 128배 압축 후 글로벌 밀집 어텐션
- 장거리 의존성 포착, CSA와 상호 보완
- Flash는 초기 2층 HCA, 이후 CSA/HCA 교차. Pro도 유사
핵심 수치 #1: 1M 토큰 KV Cache 메모리는 V3.2의 10%(Flash 7%). 동일 서버로 더 긴 컨텍스트를 처리해 인프라 비용이 낮아집니다.
3.3 다양체 제약 하이퍼커넥션(mHC)
표준 x = x + f(x) 잔차는 61층에서 그래디언트 퇴화가 쉽습니다. mHC는 4채널 잔차 스트림과 Birkhoff 다면체 제약 혼합 행렬로 신호를 안정 전파합니다.
3.4 Muon 옵티마이저
AdamW 대신 Muon 채택. 뉴턴-슐츠 직교화로 그래디언트 스텝을 안정화해 수렴 속도와 학습 안정성을 높입니다.
3.5 추론 모드
| 모드 | 특징 | 용도 |
|---|---|---|
| Non-think | 사고 체인 없음, 고속 | 간단 Q&A, 라우팅 |
| Think High | 명시 추론(<redacted_thinking>) | 중간 복잡도 디버깅 |
| Think Max | 최대 추론, 384K+ 필수 | 수학·긴 Agent |
권장 샘플링: temperature=1.0, top_p=1.0.
04 · 벤치마크: OSS 신기록
4.1 V4-Pro 주요 점수
| 벤치마크 | V4-Pro | Fable 5 | GPT-5.6 Ultra | Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ OSS 최고 | 96.0% | 별도 미공개 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
4.2 가성비(Artificial Analysis)
핵심 수치 #2: Strategy & Ops 지수 작업:
- Fable 5: 작업당 $3.48, 점수 50
- V4-Pro: 작업당 $0.03, 점수 38
- V4-Flash: 6개 카테고리 모두 $0.04 미만
비용은 116배 차이, 점수 차는 약 31%입니다.
05 · GPT-5.6 / Claude Fable 5 비교
5.1 포지셔닝
| 관점 | V4-Pro | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|
| 오픈소스 | ✅ MIT | ❌ 폐쇄 | ❌ 폐쇄 |
| 셀프호스팅 | ✅ | ❌ | ❌ |
| 컨텍스트 | 1M | 미공개 | 1M |
| 코드 | 매우 강함 | 매우 강함 | 최상위 |
| 출력(오프피크) | $0.87/M | ~$15/M | $50/M |
| 피크 출력 | $1.74/M | — | — |
| Agent | 멀티 Agent | 강함 | 최강 |
| 데이터 주권 | ✅ 온프레 | ❌ | ❌ |
5.2 선정 매트릭스
| 시나리오 | 추천 | 이유 |
|---|---|---|
| 예산·고빈도·온프레 | V4-Pro / Flash | $0.87/M 또는 $0.28/M, MIT |
| 최고 코드·비용 무관 | Fable 5 | SWE-bench Pro 80.3% |
| 알고리즘·수학 | GPT-5.6 Sol / Ultra | Terminal-Bench 85.1% |
| 초대규모 로그·문서 | V4-Flash | 캐시 $0.0028/M |
06 · 피크·오프피크 요금
6.1 가격표
| 모델 | 항목 | 오프피크 | 피크 |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | $0.0035 / 1M | 2배 |
| 입력(미스) | $0.435 / 1M | $0.87 | |
| 출력 | $0.87 / 1M | $1.74 | |
| V4-Flash | 입력(히트) | $0.0028 / 1M | 2배 |
| 입력(미스) | $0.14 / 1M | $0.28 | |
| 출력 | $0.28 / 1M | $0.56 |
피크: 베이징 시간(UTC+8) 평일 09:00–12:00, 14:00–18:00.
핵심 수치 #3: 피크에서도 V4-Pro 출력 $1.74/M는 Opus 4.8($15/M)의 8.6배 저렴합니다.
6.2 절약 4원칙
- 배치 작업은 오프피크(18:00 이후·09:00 이전)
- System Prompt 캐시로 Flash $0.0028/M 활용
- 경량은 Flash, 복잡 추론은 Pro 라우팅
- 요금 변경 24시간 전 이메일(공식 약속)
07 · API 마이그레이션(7/24 마감)⚠️
중요: deepseek-chat / deepseek-reasoner는 2026.7.24 15:59 UTC(한국 7.25 00:59)에 중단됩니다.
7.1 매핑
| 구 모델 | 신 모델 | 비고 |
|---|---|---|
deepseek-chat | deepseek-v4-flash | 비사고, 고속 |
deepseek-reasoner | deepseek-v4-flash(사고) 또는 deepseek-v4-pro | Pro로 더 강한 추론 |
7.2 6단계 이전
- 저장소 전역에서
deepseek-chat/reasoner검색(CI/CD·환경변수 포함) deepseek-v4-flash또는deepseek-v4-pro로 교체- 사고 모드:
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}} - Think Max는 컨텍스트 ≥ 384K 확인
- staging 회귀 테스트(품질·지연 비교)
- 7/24 전 프로덕션 전환, 첫 주 피크 청구 모니터링
7.3 Python 예제
7.4 Anthropic SDK
08 · 요약
V4 GA는 2026년 OSS LLM의 이정표입니다. Fable 5·GPT-5.6을 「이기는 것」이 목적이 아니라, 폐쇄 플래그십의 1/10~1/100 비용으로 OSS 최고급 성능을 제공합니다. 데이터 주권·예산·100만 토큰 Agent 중 하나라도 과제라면 V4-Pro가 가장 균형 잡힌 선택입니다.
09 · FAQ
Q: GA vs 프리뷰?
A: Agent·추론·코드 강화+피크 요금. 아키텍처는 동일 패밀리.
Q: 구 API 중단?
A: 7/24 15:59 UTC(한국 7/25 00:59).
Q: 피크 시간?
A: 베이징 평일 09–12시, 14–18시.
Q: Mac 로컬?
A: Flash 양자화 시험 가능. 로컬 추론 가이드 참고.
10 · 격리 Mac 대여로 마이그레이션 검증
7/24 전 메인 MacBook에서 deepseek-chat를 일괄 교체하기보다 격리된 Apple Silicon 노드에서 검증하는 편이 안전합니다. 프로덕션 서브셋을 클론하고 deepseek-v4-flash / deepseek-v4-pro로 회귀 테스트해 피크 청구와 출력 품질을 비교하세요. 메인 머신에서는 shell 설정 잔존·사고 모드 실험 캐시 오염이 흔합니다.
Windows/Linux API 호출은 가능하지만 macOS 네이티브 툴체인·Keychain·Xcode 사이드카 공존은 검증할 수 없습니다. 일 단위 M 시리즈 Mac mini는 검증 후 폐기 가능한 격리 환경입니다. 요금·SSH는 M 시리즈 Mac 연산 대여 요금을 보세요.
기존 노트북에서 API 라우트를 바꿀 수 있지만, 재현 가능한 마이그레이션 검증과 Keychain 오염 리스크 감소를 원한다면 격리 Mac 대여가 실무상 최적해인 경우가 많습니다.
11 · 참고 자료
데이터 기준: 2026년 7월 20일. 최신 정보는 공식 문서를 확인하세요.