DeepSeek V4 정식 출시(2026년 7월): 가격·벤치마크·GPT-5.6 비교 가이드

약 18분 소요 · MACCOME · 마지막 업데이트: 2026년 7월 20일

대상 독자: AI 개발자, 개인 개발자, API 선정·마이그레이션을 담당하는 기업 기술 리더, 오픈소스 대형 모델에 관심 있는 Agent 엔지니어입니다. 2026년 7월 20일 DeepSeek V4 정식판(GA)이 공개되었습니다. 4월 프리뷰 대비 Agent·수학 추론·코드 생성이 강화되었고, 최초로 피크/오프피크 요금이 도입되었습니다. 본문 제공 내용: 전체 타임라인, V4-Pro/V4-Flash 사양, CSA/HCA/mHC/Muon 아키텍처, SWE-bench 벤치마크, 116배 비용 비율, 3모델 비교 매트릭스, 요금표·절감 전략, 7월 24일 API 마이그레이션 매핑·코드 예제, 6단계 Runbook입니다. 구성: 페인포인트 → 타임라인 → 아키텍처 → 벤치마크 → 가성비 → 비교 매트릭스 → 피크/오프피크 → 마이그레이션 → Runbook → 결론·전환. 로컬 추론 판단은 DeepSeek V4 Flash 로컬 vs 클라우드 대여를 참고하십시오.

bolt

TL;DR — 30초 결론

  • GA 정식판 오늘 공개: 프리뷰(4/24)에서 프로덕션 품질로 승격. Agent/수학/코드 전면 강화, 피크/오프피크 요금 최초 도입.
  • OSS 최강 코딩 성능: SWE-bench Verified 80.6%는 OSS 최고. LiveCodeBench 93.5%, Codeforces Elo 3,206 동급 선두.
  • 1M 컨텍스트 실사용 가능: CSA+HCA 하이브리드 어텐션으로 KV 캐시 V3.2의 10%(Flash 7%), 추론 FLOPs 27%.
  • 116배 비용 격차: Artificial Analysis 기준 V4-Pro 작업당 $0.03 vs Claude Fable 5 $3.48, 점수 차 약 12점.
  • 7월 24일 마이그레이션 마감: deepseek-chat, deepseek-reasoner 영구 중단. 기한 전 API 업데이트 필수.

6대 페인포인트: GA 공개 후 가장 많이 막히는 의사결정 공백

DeepSeek V4 GA 공개 이후 엔지니어링 팀은 다음 6가지 공백에 막힙니다. 「저렴하고 강하다」는 것은 알지만, 신규 요금 체계와 마이그레이션 기한을 프로덕션 운영으로 전환하지 못합니다.

  1. 피크/오프피크 요금 복잡도: 평일 피크 시간대 요금 2배. 7×24 Agent 파이프라인에 스케줄링이 없으면 청구액이 50% 이상 초과할 수 있습니다.
  2. 7월 24일 마이그레이션 기한: deepseek-chat, deepseek-reasoner 영구 중단. 미갱신 코드는 즉시 서비스 중단으로 이어집니다.
  3. 벤치마크 vs 폐쇄 플래그십 격차: SWE-bench Verified 80.6%는 OSS 최고이나 Claude Fable 5는 96%. 「충분」과 「최강」 경계를 정리해야 합니다.
  4. Pro vs Flash 선정: 1.6T Pro와 284B Flash 모두 1M 컨텍스트이나 활성 파라미터 3.8배 차. 오선정은 비용 낭비 또는 품질 저하를 초래합니다.
  5. 116배 비용비 해석: Fable 5 작업당 $3.48, V4-Pro $0.03. 점수 차 12점 — 고빈도·최고품질 워크로드는 분리 라우팅이 필요합니다.
  6. 로컬 배포 vs API 라우팅: MIT 오픈 가중치로 자체 호스팅 가능하나, 1.6T MoE 프로덕션 배포에는 멀티 GPU 서버가 필요하며 노트북으로는 불가능합니다.

아래에서는 공식 문서, arXiv:2606.19348, Artificial Analysis 데이터로 위 6가지 공백을 순차적으로 메웁니다.

타임라인: 프리뷰에서 정식판까지

시점사건
2026년 4월 24일V4 프리뷰 공개 + OSS(MIT). V4-Pro(1.6T), V4-Flash(284B) 포함
2026년 5월프로덕션 튜닝 버전 공개, API 정식 이용 가능
2026년 6월V4-Pro 출력가 75% 영구 인하($0.87/M tokens)
2026년 6월 29일DeepSeek가 API 사용자에 GA(7월 중순) 및 피크/오프피크 요금 메일 공지
2026년 7월 19일다수 개발자 GA 그레이 테스트 자격 획득, 언론 「정식판 내일 공개」 보도
2026년 7월 20일GA 정식판 공개(본문 발행일)
2026년 7월 24일구명 deepseek-chat/deepseek-reasoner 영구 중단

한 문장 요약: 아키텍처 변경 없음. GA는 프리뷰의 Agent·수학·코드 능력을 강화하고 공식 상업 요금 체계를 갖춘 릴리스입니다.

모델 패밀리: V4-Pro vs V4-Flash 사양

사양V4-ProV4-Flash
총 파라미터1.6조(1.6T)2,840억(284B)
토큰당 활성 파라미터490억(49B)130억(13B)
Transformer 레이어61층43층
컨텍스트 윈도우1,000,000 tokens1,000,000 tokens
최대 출력384K tokens384K tokens
정밀도FP4(전문가)+FP8(기타)FP4+FP8 혼합
사전학습 데이터33T+ tokens32T+ tokens
라이선스MITMIT

아키텍처 혁신: CSA, HCA, mHC, Muon

기존 Transformer KV 캐시 메모리는 컨텍스트 길이에 비례 증가하여 1M token은 사실상 불가능했습니다. DeepSeek V4는 V2/V3 MLA를 폐기하고 두 가지 신규 어텐션 메커니즘을 결합합니다.

4.1 압축 희소 어텐션(CSA)

  • Softmax 게이트 풀링으로 KV 시퀀스 4배 압축;
  • FP4 정밀도 Lightning Indexer로 top-k 희소 선택(Pro top-1024, Flash top-512);
  • 최근 128 token 슬라이딩 윈도우 유지;
  • 1M 컨텍스트 추론 FLOPs는 DeepSeek V3.2의 27%만 소모합니다.

4.2 고압축 어텐션(HCA)

  • token 128배 압축 후 글로벌 밀집 어텐션으로 장거리 의존성 포착;
  • CSA와 상호 보완. Flash는 초기 2층 HCA, 이후 CSA/HCA 교차. Pro도 유사 구조.

종합 효과: 1M token에서 KV 캐시 메모리는 V3.2의 10%(Flash 7%).

4.3 다양체 제약 하이퍼 연결(mHC)

표준 잔차 연결을 업그레이드합니다. 4채널 잔차 스트림과 이중 확률 행렬 제약(Birkhoff 다면체) 혼합 행렬로 61층 깊은 네트워크에서도 신호가 안정 전파됩니다.

4.4 Muon 옵티마이저

AdamW 대신 Muon으로 학습합니다. Newton-Schulz 직교화로 그래디언트를 처리하여 수렴이 빠르고 학습이 안정적입니다.

3가지 추론 모드

모드특징적합 시나리오
Non-think사고 체인 없음, 고속 응답단순 Q&A, 라우팅
Think High명시적 추론(<redacted_thinking>)중간 복잡도, 디버깅
Think Max최대 추론 강도, 384K+ 컨텍스트 필요복잡 수학, 장체인 Agent

공식 권장 샘플링: temperature=1.0, top_p=1.0(전 모드 공통).

벤치마크: OSS 최고 성적표

벤치마크DeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6%(OSS 최고)96.0%별도 미공개~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified는 실제 GitHub 저장소 버그 수정 테스트입니다. 80.6%는 현재 OSS 최고이며 Gemini 3.1 Pro와 동률입니다. 더 엄격한 SWE-bench Pro에서는 Claude Fable 5가 80.3%로 선두입니다.

116배 비용비: 가성비 횡단 분석

Artificial Analysis Strategy & Ops 지수 작업 결과:

  • Claude Fable 5: 작업당 $3.48, 점수 50;
  • DeepSeek V4-Pro: 작업당 $0.03, 점수 38;
  • DeepSeek V4-Flash: 6개 지수 모두 작업당 $0.04 미만.

Fable 5 비용은 V4-Pro의 116배이나 점수 차는 약 12점(31%)입니다. 대부분 프로덕션 시나리오에서 V4-Pro 가성비가 압도적입니다. OpenRouter 점유율 변화는 OpenRouter 6월 랭킹 분석을 참고하십시오.

3모델 비교 매트릭스: V4-Pro vs GPT-5.6 Sol vs Claude Fable 5

차원DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
오픈소스MIT폐쇄폐쇄
자체 호스팅가능불가불가
컨텍스트1M tokens미공개1M tokens
코드 능력매우 강함(Fable 5 근접)매우 강함최강
API 출력(오프피크)$0.87/M tokens~$15/M$50/M
API 출력(피크)$1.74/M tokens
Agent 능력강함, 멀티 Agent 지원강함최강
데이터 프라이버시프라이빗 배포 가능불가불가

시나리오 선정: 예산 제약/고빈도 호출/프라이빗 배포 → V4-Pro 또는 V4-Flash. 최고 코드 성능 → Claude Fable 5. 복잡 알고리즘+수학 → GPT-5.6 Sol/Ultra. 대규모 로그 처리 → V4-Flash(캐시 히트 입력 $0.0028/M). 코딩 어시스턴트 비교는 AI 코딩 어시스턴트 선정 매트릭스를 참고하십시오.

피크/오프피크 요금: 전체 가격표와 절감 전략

GA판 최대 관심 변화입니다. DeepSeek가 최초로 시간대별 요금을 도입했습니다. 피크 시간(베이징): 평일 09:00–12:00, 14:00–18:00, 요금 2배.

모델항목오프피크피크
V4-Pro입력(캐시 히트)¥0.025 / $0.0035 / 1M2배
V4-Pro입력(캐시 미스)¥3.00 / $0.435 / 1M¥6.00 / $0.87
V4-Pro출력¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash입력(캐시 히트)¥0.02 / $0.0028 / 1M2배
V4-Flash입력(캐시 미스)¥1.00 / $0.14 / 1M¥2.00 / $0.28
V4-Flash출력¥2.00 / $0.28 / 1M¥4.00 / $0.56

4가지 절감 전략:

  1. 비실시간 작업을 오프피크로: 배치 문서 처리, 데이터 라벨링, 코드 리뷰를 18:00 이후 또는 9:00 이전 실행;
  2. 캐시 히트 극대화: 고정 System Prompt로 Prompt Cache 구성. V4-Flash 캐시 히트 $0.0028/M;
  3. Flash 분류 라우팅: 의도 분류·라우팅은 V4-Flash, 복잡 추론은 V4-Pro로 에스컬레이션;
  4. 청구 알림 확인: DeepSeek는 요금 변경 24시간 전 메일 알림을 약속합니다.

피크 시에도 V4-Pro 출력($1.74/M)은 Claude Opus 4.8($15/M)보다 8.6배 저렴합니다.

API 마이그레이션 가이드: 7월 24일 마감

구 모델명 deepseek-chat, deepseek-reasoner2026년 7월 24일 15:59 UTC(베이징 23:59)에 영구 중단됩니다.

구 모델명신 모델명비고
deepseek-chatdeepseek-v4-flash(비사고 모드)고속, 경량 작업
deepseek-reasonerdeepseek-v4-flash(사고 모드)또는 deepseek-v4-pro 업그레이드

OpenAI SDK 예제(Python):

python
# 구写法(7월 24일 이후 무효)
client.chat.completions.create(
    model="deepseek-chat",
    messages=[...]
)

# 신写法
client.chat.completions.create(
    model="deepseek-v4-pro",          # 또는 deepseek-v4-flash
    messages=[...],
    # extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

Anthropic SDK 호환: V4는 OpenAI ChatCompletions와 Anthropic Messages 모두 지원합니다. base_url은 유지하고 model만 갱신합니다.

python
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
warning

중요: 프로덕션에서 deepseek-chat 또는 deepseek-reasoner를 사용 중이면 7월 24일 전 스테이징 테스트와 배포를 완료하십시오. 미갱신 시 서비스가 중단됩니다.

6단계 Runbook: 평가에서 프로덕션 라우팅까지

  1. 코드베이스 구 모델명 검색: deepseek-chat, deepseek-reasoner 전역 검색 후 호출 지점 목록화.
  2. 신 모델로 매핑: 경량 채팅 → deepseek-v4-flash. 추론 작업 → Flash 사고 모드 또는 deepseek-v4-pro.
  3. 피크/오프피크 스케줄 구성: 배치 작업(요약, 코드 리뷰)을 18:00 이후 또는 9:00 이전 실행해 피크 회피.
  4. Prompt Cache 활성화: 고정 System Prompt를 메시지 앞에 배치, 캐시 히트율·실제 청구 검증.
  5. Flash/Pro 계층 라우팅 배포: 의도 분류·FAQ는 Flash, 복잡 Agent·Repo 수준 수정은 Pro.
  6. 7월 24일 전 스테이징 검증: 신 모델명·사고 모드 테스트. Think Max는 384K+ 컨텍스트 설정 필요.

인용할 3대 핵심 데이터

  • 80.6% — SWE-bench Verified 점수, OSS 최고, Gemini 3.1 Pro 동률
  • 116× — V4-Pro 작업 $0.03 vs Claude Fable 5 $3.48 비용비
  • 10% / 7% — 1M token에서 V4-Pro/V4-Flash KV 캐시가 V3.2 대비 비율

결론: 정식판은 기대할 가치가 있으나 마이그레이션·스케줄링을 직시해야 합니다

DeepSeek V4 GA는 2026년 OSS 대형 모델 분야 최중요 이정표 중 하나입니다. 가치는 Claude Fable 5나 GPT-5.6을 능가하는 것(현재는 아직)이 아니라, 폐쇄 플래그십 1/10~1/100 비용으로 OSS 최고 성능을 제공하는 데 있습니다. 데이터 반출을 원치 않는 기업, 예산 제약 개인 개발자, 1M token Agent 엔지니어에게 V4-Pro는 현재 가장 균형 잡힌 선택입니다.

그러나 DeepSeek V4 기반 Agent 워크플로(OpenClaw Gateway, 다모델 하이브리드 라우팅)를 프로덕션에서 안정 운영하려면 로컬 MacBook은 3가지 구조적 병목에 부딪힙니다.

  • 슬립·네트워크 지터: 덮개 닫힘·Wi-Fi 전환 시 장시간 Agent 세션 중단, 소비 토큰 환불 불가;
  • 연산 경합: 로컬 IDE, Simulator, Agent가 통합 메모리 경쟁, 장컨텍스트 추론 처리량 저하;
  • 진정한 7×24 라우팅 노드 부재: 하이브리드 모델 전략은 상주 Gateway 필요, 노트북은 스케줄링 허브에 부적합.

DeepSeek V4 + 다모델 Agent 스택을 안정 운영하려면 MACCOME Mac 클라우드 호스트가 실제 macOS, SSH 인수, 격리 환경을 제공하여 Agent가 전용 노드에서 7×24 실행됩니다. 공개 요금은 Mac mini 대여 가격을 참고하십시오.

주목 일정: 7월 24일(구 API 중단) → 피크/오프피크 요금 전면 적용 → GA 후속 최적화 공지 지속 모니터링.

데이터 출처: DeepSeek 공식 문서, arXiv:2606.19348, Hugging Face 모델 페이지, Artificial Analysis, LLMReference. 2026년 7월 20일 기준.

자주 묻는 질문

deepseek-chat 중단 후 어떻게 마이그레이션합니까?

deepseek-chatdeepseek-v4-flash(비사고 모드)로, deepseek-reasoner를 Flash 사고 모드 또는 deepseek-v4-pro로 교체하십시오. 구명은 2026년 7월 24일 23:59(베이징 시간)에 영구 중단됩니다.

DeepSeek V4 피크/오프피크 요금은 어떻게 계산됩니까?

평일 09:00–12:00, 14:00–18:00(베이징)이 피크이며 요금 2배입니다. V4-Pro 오프피크 출력 $0.87/M, 피크 $1.74/M. 비실시간 작업을 오프피크로 배치하면 약 50% 절감 가능합니다.

V4-Pro와 V4-Flash 중 무엇을 선택해야 합니까?

V4-Pro(1.6T, 49B 활성)는 복잡 추론·Agent·코드 생성용입니다. V4-Flash(284B, 13B 활성)는 고빈도 경량·라우팅용이며 캐시 히트 입력 $0.0028/M입니다.

DeepSeek V4와 GPT-5.6는 어떻게 비교됩니까?

V4-Pro는 LiveCodeBench·Codeforces에서 선두, GPT-5.6 Sol은 Terminal-Bench에서 우위입니다. 비용은 V4-Pro 출력 $0.87/M vs GPT-5.6 약 $15/M, 약 17배 차. 상세는 3모델 비교 매트릭스 참조.

7월 24일 이후 어떻게 됩니까?

deepseek-chat 또는 deepseek-reasoner API 호출은 오류를 반환합니다. 기한 전 deepseek-v4-flash 또는 deepseek-v4-pro로 갱신하고 스테이징 테스트를 완료하십시오.

프로덕션에서 DeepSeek V4 Agent를 7×24 운영하려면?

전용 Mac 클라우드 호스트에 OpenClaw Gateway 또는 다모델 라우터를 배포해 노트북 슬립으로 장세션이 끊기는 것을 방지하십시오. MACCOME Mac 대여 요금에서 노드 구성·가격을 확인하십시오.