대상 독자: AI 개발자, 개인 개발자, API 선정·마이그레이션을 담당하는 기업 기술 리더, 오픈소스 대형 모델에 관심 있는 Agent 엔지니어입니다. 2026년 7월 20일 DeepSeek V4 정식판(GA)이 공개되었습니다. 4월 프리뷰 대비 Agent·수학 추론·코드 생성이 강화되었고, 최초로 피크/오프피크 요금이 도입되었습니다. 본문 제공 내용: 전체 타임라인, V4-Pro/V4-Flash 사양, CSA/HCA/mHC/Muon 아키텍처, SWE-bench 벤치마크, 116배 비용 비율, 3모델 비교 매트릭스, 요금표·절감 전략, 7월 24일 API 마이그레이션 매핑·코드 예제, 6단계 Runbook입니다. 구성: 페인포인트 → 타임라인 → 아키텍처 → 벤치마크 → 가성비 → 비교 매트릭스 → 피크/오프피크 → 마이그레이션 → Runbook → 결론·전환. 로컬 추론 판단은 DeepSeek V4 Flash 로컬 vs 클라우드 대여를 참고하십시오.
TL;DR — 30초 결론
deepseek-chat, deepseek-reasoner 영구 중단. 기한 전 API 업데이트 필수.DeepSeek V4 GA 공개 이후 엔지니어링 팀은 다음 6가지 공백에 막힙니다. 「저렴하고 강하다」는 것은 알지만, 신규 요금 체계와 마이그레이션 기한을 프로덕션 운영으로 전환하지 못합니다.
deepseek-chat, deepseek-reasoner 영구 중단. 미갱신 코드는 즉시 서비스 중단으로 이어집니다.아래에서는 공식 문서, arXiv:2606.19348, Artificial Analysis 데이터로 위 6가지 공백을 순차적으로 메웁니다.
| 시점 | 사건 |
|---|---|
| 2026년 4월 24일 | V4 프리뷰 공개 + OSS(MIT). V4-Pro(1.6T), V4-Flash(284B) 포함 |
| 2026년 5월 | 프로덕션 튜닝 버전 공개, API 정식 이용 가능 |
| 2026년 6월 | V4-Pro 출력가 75% 영구 인하($0.87/M tokens) |
| 2026년 6월 29일 | DeepSeek가 API 사용자에 GA(7월 중순) 및 피크/오프피크 요금 메일 공지 |
| 2026년 7월 19일 | 다수 개발자 GA 그레이 테스트 자격 획득, 언론 「정식판 내일 공개」 보도 |
| 2026년 7월 20일 | GA 정식판 공개(본문 발행일) |
| 2026년 7월 24일 | 구명 deepseek-chat/deepseek-reasoner 영구 중단 |
한 문장 요약: 아키텍처 변경 없음. GA는 프리뷰의 Agent·수학·코드 능력을 강화하고 공식 상업 요금 체계를 갖춘 릴리스입니다.
| 사양 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조(1.6T) | 2,840억(284B) |
| 토큰당 활성 파라미터 | 490억(49B) | 130억(13B) |
| Transformer 레이어 | 61층 | 43층 |
| 컨텍스트 윈도우 | 1,000,000 tokens | 1,000,000 tokens |
| 최대 출력 | 384K tokens | 384K tokens |
| 정밀도 | FP4(전문가)+FP8(기타) | FP4+FP8 혼합 |
| 사전학습 데이터 | 33T+ tokens | 32T+ tokens |
| 라이선스 | MIT | MIT |
기존 Transformer KV 캐시 메모리는 컨텍스트 길이에 비례 증가하여 1M token은 사실상 불가능했습니다. DeepSeek V4는 V2/V3 MLA를 폐기하고 두 가지 신규 어텐션 메커니즘을 결합합니다.
종합 효과: 1M token에서 KV 캐시 메모리는 V3.2의 10%(Flash 7%).
표준 잔차 연결을 업그레이드합니다. 4채널 잔차 스트림과 이중 확률 행렬 제약(Birkhoff 다면체) 혼합 행렬로 61층 깊은 네트워크에서도 신호가 안정 전파됩니다.
AdamW 대신 Muon으로 학습합니다. Newton-Schulz 직교화로 그래디언트를 처리하여 수렴이 빠르고 학습이 안정적입니다.
| 모드 | 특징 | 적합 시나리오 |
|---|---|---|
| Non-think | 사고 체인 없음, 고속 응답 | 단순 Q&A, 라우팅 |
| Think High | 명시적 추론(<redacted_thinking>) | 중간 복잡도, 디버깅 |
| Think Max | 최대 추론 강도, 384K+ 컨텍스트 필요 | 복잡 수학, 장체인 Agent |
공식 권장 샘플링: temperature=1.0, top_p=1.0(전 모드 공통).
| 벤치마크 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(OSS 최고) | 96.0% | 별도 미공개 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified는 실제 GitHub 저장소 버그 수정 테스트입니다. 80.6%는 현재 OSS 최고이며 Gemini 3.1 Pro와 동률입니다. 더 엄격한 SWE-bench Pro에서는 Claude Fable 5가 80.3%로 선두입니다.
Artificial Analysis Strategy & Ops 지수 작업 결과:
Fable 5 비용은 V4-Pro의 116배이나 점수 차는 약 12점(31%)입니다. 대부분 프로덕션 시나리오에서 V4-Pro 가성비가 압도적입니다. OpenRouter 점유율 변화는 OpenRouter 6월 랭킹 분석을 참고하십시오.
| 차원 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 오픈소스 | MIT | 폐쇄 | 폐쇄 |
| 자체 호스팅 | 가능 | 불가 | 불가 |
| 컨텍스트 | 1M tokens | 미공개 | 1M tokens |
| 코드 능력 | 매우 강함(Fable 5 근접) | 매우 강함 | 최강 |
| API 출력(오프피크) | $0.87/M tokens | ~$15/M | $50/M |
| API 출력(피크) | $1.74/M tokens | — | — |
| Agent 능력 | 강함, 멀티 Agent 지원 | 강함 | 최강 |
| 데이터 프라이버시 | 프라이빗 배포 가능 | 불가 | 불가 |
시나리오 선정: 예산 제약/고빈도 호출/프라이빗 배포 → V4-Pro 또는 V4-Flash. 최고 코드 성능 → Claude Fable 5. 복잡 알고리즘+수학 → GPT-5.6 Sol/Ultra. 대규모 로그 처리 → V4-Flash(캐시 히트 입력 $0.0028/M). 코딩 어시스턴트 비교는 AI 코딩 어시스턴트 선정 매트릭스를 참고하십시오.
GA판 최대 관심 변화입니다. DeepSeek가 최초로 시간대별 요금을 도입했습니다. 피크 시간(베이징): 평일 09:00–12:00, 14:00–18:00, 요금 2배.
| 모델 | 항목 | 오프피크 | 피크 |
|---|---|---|---|
| V4-Pro | 입력(캐시 히트) | ¥0.025 / $0.0035 / 1M | 2배 |
| V4-Pro | 입력(캐시 미스) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 |
| V4-Pro | 출력 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 |
| V4-Flash | 입력(캐시 히트) | ¥0.02 / $0.0028 / 1M | 2배 |
| V4-Flash | 입력(캐시 미스) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 |
| V4-Flash | 출력 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
4가지 절감 전략:
피크 시에도 V4-Pro 출력($1.74/M)은 Claude Opus 4.8($15/M)보다 8.6배 저렴합니다.
구 모델명 deepseek-chat, deepseek-reasoner는 2026년 7월 24일 15:59 UTC(베이징 23:59)에 영구 중단됩니다.
| 구 모델명 | 신 모델명 | 비고 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(비사고 모드) | 고속, 경량 작업 |
deepseek-reasoner | deepseek-v4-flash(사고 모드) | 또는 deepseek-v4-pro 업그레이드 |
OpenAI SDK 예제(Python):
# 구写法(7월 24일 이후 무효)
client.chat.completions.create(
model="deepseek-chat",
messages=[...]
)
# 신写法
client.chat.completions.create(
model="deepseek-v4-pro", # 또는 deepseek-v4-flash
messages=[...],
# extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
Anthropic SDK 호환: V4는 OpenAI ChatCompletions와 Anthropic Messages 모두 지원합니다. base_url은 유지하고 model만 갱신합니다.
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
중요: 프로덕션에서 deepseek-chat 또는 deepseek-reasoner를 사용 중이면 7월 24일 전 스테이징 테스트와 배포를 완료하십시오. 미갱신 시 서비스가 중단됩니다.
deepseek-chat, deepseek-reasoner 전역 검색 후 호출 지점 목록화.deepseek-v4-flash. 추론 작업 → Flash 사고 모드 또는 deepseek-v4-pro.DeepSeek V4 GA는 2026년 OSS 대형 모델 분야 최중요 이정표 중 하나입니다. 가치는 Claude Fable 5나 GPT-5.6을 능가하는 것(현재는 아직)이 아니라, 폐쇄 플래그십 1/10~1/100 비용으로 OSS 최고 성능을 제공하는 데 있습니다. 데이터 반출을 원치 않는 기업, 예산 제약 개인 개발자, 1M token Agent 엔지니어에게 V4-Pro는 현재 가장 균형 잡힌 선택입니다.
그러나 DeepSeek V4 기반 Agent 워크플로(OpenClaw Gateway, 다모델 하이브리드 라우팅)를 프로덕션에서 안정 운영하려면 로컬 MacBook은 3가지 구조적 병목에 부딪힙니다.
DeepSeek V4 + 다모델 Agent 스택을 안정 운영하려면 MACCOME Mac 클라우드 호스트가 실제 macOS, SSH 인수, 격리 환경을 제공하여 Agent가 전용 노드에서 7×24 실행됩니다. 공개 요금은 Mac mini 대여 가격을 참고하십시오.
주목 일정: 7월 24일(구 API 중단) → 피크/오프피크 요금 전면 적용 → GA 후속 최적화 공지 지속 모니터링.
데이터 출처: DeepSeek 공식 문서, arXiv:2606.19348, Hugging Face 모델 페이지, Artificial Analysis, LLMReference. 2026년 7월 20일 기준.
자주 묻는 질문
deepseek-chat 중단 후 어떻게 마이그레이션합니까?
deepseek-chat을 deepseek-v4-flash(비사고 모드)로, deepseek-reasoner를 Flash 사고 모드 또는 deepseek-v4-pro로 교체하십시오. 구명은 2026년 7월 24일 23:59(베이징 시간)에 영구 중단됩니다.
DeepSeek V4 피크/오프피크 요금은 어떻게 계산됩니까?
평일 09:00–12:00, 14:00–18:00(베이징)이 피크이며 요금 2배입니다. V4-Pro 오프피크 출력 $0.87/M, 피크 $1.74/M. 비실시간 작업을 오프피크로 배치하면 약 50% 절감 가능합니다.
V4-Pro와 V4-Flash 중 무엇을 선택해야 합니까?
V4-Pro(1.6T, 49B 활성)는 복잡 추론·Agent·코드 생성용입니다. V4-Flash(284B, 13B 활성)는 고빈도 경량·라우팅용이며 캐시 히트 입력 $0.0028/M입니다.
DeepSeek V4와 GPT-5.6는 어떻게 비교됩니까?
V4-Pro는 LiveCodeBench·Codeforces에서 선두, GPT-5.6 Sol은 Terminal-Bench에서 우위입니다. 비용은 V4-Pro 출력 $0.87/M vs GPT-5.6 약 $15/M, 약 17배 차. 상세는 3모델 비교 매트릭스 참조.
7월 24일 이후 어떻게 됩니까?
deepseek-chat 또는 deepseek-reasoner API 호출은 오류를 반환합니다. 기한 전 deepseek-v4-flash 또는 deepseek-v4-pro로 갱신하고 스테이징 테스트를 완료하십시오.
프로덕션에서 DeepSeek V4 Agent를 7×24 운영하려면?
전용 Mac 클라우드 호스트에 OpenClaw Gateway 또는 다모델 라우터를 배포해 노트북 슬립으로 장세션이 끊기는 것을 방지하십시오. MACCOME Mac 대여 요금에서 노드 구성·가격을 확인하십시오.