대상 독자: AI 개발자, Agent 엔지니어, API 선정·비용 통제를 담당하는 기업 기술 리더입니다. 2026년 7월 31일 DeepSeek가 V4-Flash를 정식판 0731로 승격했습니다. 파라미터 규모는 불변, 재학습만으로 Agent 벤치마크가 자사 대형 V4-Pro 프리뷰를 초과했으며, 가격은 Claude Opus 4.8의 수십 분의 일 수준입니다. 본문 제공 내용: 전체 타임라인, 5사 가격 비교표, Harness 프레임워크 해설, Artificial Analysis 횡단 비교, 벤치마크 논쟁 경계, 6단계 Runbook입니다. 구성: 페인포인트 → 타임라인 → 가격 매트릭스 → 아키텍처 → 경쟁 구도 → 논점 → Runbook → 결론·전환. 7/20 GA·피크/오프피크 요금은 V4 GA 출시 글을, Kimi K3 비교는 K3 오픈 웨이트 글을 참고하십시오.
TL;DR — 30초 결론
7/31 정식판 GA 이후 기술 팀은 다음 6가지 공백에 막힙니다. 각 항목은 API 청구액과 Agent 품질에 직접 영향을 줍니다.
| 시점 | 사건 |
|---|---|
| 2026-04-24 | V4 프리뷰 공개·OSS: V4-Pro(1.6T / 49B 활성), V4-Flash(284B / 13B 활성), 1M 컨텍스트, MIT |
| 2026-07-24 | 구 API deepseek-chat, deepseek-reasoner 영구 중단, V4 시리즈 명명으로 전환 |
| 2026-07-27 | Moonshot Kimi K3(2.8T) 오픈 웨이트 Hugging Face 공개, DeepSeek에 경쟁 압력 |
| 2026-07-31 | V4-Flash-0731 정식판 API 공개 테스트, OSS 가중치 동기 공개; changelog에 자체 Agent 프레임워크 「Harness」 최초 명시 |
| 2026-08-02 | Alibaba Qwen3.8-Max API GA(가중치 대기), 중국 OSS 진영 경쟁 심화 |
| 2026-08-05(발행 시점) | V4-Pro 정식판 미출시; Harness 미공개; 앱·웹 0731 미동기 |
아래 가격은 제조사 공개 데이터(2026-08-05 기준)이며 「자체 보고」 정보입니다. GLM-5.2 일부 필드는 본문 검증 범위 밖입니다.
| 모델 | 상태 | 총 파라미터 / 활성 | 컨텍스트 | 입력(미스/히트, $/M) | 출력($/M) | 라이선스 |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | 정식판 | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| V4-Pro | 프리뷰 | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 가중치 OSS | 2.8T / ~104B(커뮤니티 추정) | ~1.05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| GLM-5.2 | OSS | ~744B / ~40B | 1M | 미검증 | 미검증 | MIT |
| Qwen3.8-Max | API GA | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | OSS 약속 |
| GPT-5.6 Sol | 폐쇄 | 미공개 | — | — | — | 폐쇄 |
| Claude Fable 5 | 폐쇄 | 미공개 | 1M | — | ~$50 | 폐쇄 |
가장 놓치기 쉬운 핵심은 V4-Flash-0731이 4월 프리뷰와 파라미터·구조가 동일하다는 점입니다. 성능 향상은 재후학습에서만 발생했습니다. 284B 총·13B 활성 Flash가 여러 Agent 벤치마크에서 수 배 큰 V4-Pro 프리뷰를 초과 — 2026년 하반기 「후학습 품질」이 「파라미터 적층」에 추격·초과하는 추세를 뒷받침합니다.
기술 보고서 《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》에 따르면 V4 시리즈 아키텍처 핵심 변경 3가지는 다음과 같습니다.
7/31 changelog에 DeepSeek Harness가 최초 공식 등장했습니다. 파일 읽기·쓰기, 도구 호출, 명령 실행, 엔드투엔드 엔지니어링 과제를 처리하는 자체 Agent 실행 프레임워크로 Claude Code에 대응합니다. 이전까지 DeepSeek 모델은 Claude Code, OpenCode 등 서드파티 Agent에 주로 의존했습니다.
공식 Agent 벤치마크(Terminal Bench 2.0, Toolathlon 등)는 전부 Harness minimal mode 기준이며, max 티어·top_p=0.95·temperature=1.0입니다. changelog에서 「벤치마크는 harness 선택에 매우 민감하며 모델 자체 능력 향상과 동일시할 수 없다」고 명시합니다.
| 모델 | 랩 | Intelligence Index(서드파티) | 작업당 평균 비용(서드파티) |
|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0.03 |
| Kimi K3 | Moonshot | 57 | $0.86 |
| GLM-5.2 | 智谱/Z.ai | Flash 대비 약 +1 | 미검증 |
| GPT-5.6 Sol | OpenAI | Flash 대비 +9 이상 | $1.86 |
| Claude Fable 5 | Anthropic | Flash 대비 +9 이상 | $3.15 |
출처: Artificial Analysis 독립 평가(경제 매체 인용). DeepSeek 자체 Agent 벤치마크(Terminal Bench 2.0 등)와 방법론이 다르며 직접 합산 비교 불가입니다.
역설적 대비: V4-Flash 지능 점수는 Kimi K3·GLM-5.2에 뒤지나 작업당 비용은 Kimi K3의 약 1/29, GPT-5.6 Sol의 1/62, Claude Fable 5의 1/105입니다. DeepSeek는 「1위 벤치마크」가 아니라 「충분한 지능 + 극한 가격」을 겨냥합니다 — 프리뷰가 OpenRouter 7주 연속 1위를 유지한 이유입니다.
V4-Pro 연기 기간 중국 AI 커뮤니티는 창립자 梁文锋를 「梁白开」(「白等」)로 농담했습니다. Flash-0731 초과 기대 후 「梁圣」로 되돌아갔습니다. 더 주목할 개념은 「참수선」입니다. DeepSeek가 「충분한 성능 + 극단적 저가」로 시장 문턱을 설정 — 경쟁사가 성능을 뚜렷이 넘기지 못하고 더 낮은 가격을 제시하지 못하면 존재감을 잃을 수 있다는 논의입니다. 동기 OpenAI GPT-5.6 Luna 80% 일괄 인하 등 밀집 가격 조정을 설명합니다(OpenAI 인하 글 참조).
7/31 출시 당일 NVIDIA·Broadcom·AMD 등 연산 주식은 뚜렷한 변동 없었습니다 — 2025년 초 DeepSeek-R1로 글로벌 AI 칩주 하락을 촉발한 것과 대조적이며, 시장은 「DeepSeek식 효율 돌파」 내러티브에 익숙해진 것으로 해석됩니다.
deepseek-v4-flash는 0731 정식판을 자동 가리킵니다. 중단된 deepseek-chat 사용 시 즉시 전환하십시오(마이그레이션은 GA 마이그레이션 가이드).from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
# deepseek-v4-flash는 0731 정식판을 자동 가리킴
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "이 Agent 로그를 분석해 주세요..."}],
)
DeepSeek V4-Flash-0731의 가치는 Claude Fable 5나 GPT-5.6 Sol의 절대 지능 상한을 능가하는 것이 아닙니다. 폐쇄 플래그십 1/36~1/179 가격으로 대규모 Agent·배치에 「충분한」 OSS 선택지를 제공하는 데 있습니다. 예산 민감·프라이빗 배포·고빈도 호출 팀에게 Flash 정식판은 현재 가성비 최상위 옵션 중 하나입니다.
그러나 프로덕션에서 DeepSeek V4 Agent 워크플로(OpenClaw Gateway, Harness 향후 연동, 다모델 하이브리드 라우팅)를 안정 운영하려면 3가지 구조적 병목이 있습니다.
DeepSeek V4 + 다모델 Agent 하이브리드 스택을 안정 운영하려면 MACCOME Mac 클라우드 호스트가 실제 macOS, SSH 인수, 격리 환경을 제공하여 Agent가 전용 노드에서 7×24 실행됩니다. 공개 요금은 Mac mini 대여 가격을 참고하십시오.
데이터 출처: DeepSeek 공식 API 문서·changelog, 기술 보고서, Hugging Face 모델 카드, Artificial Analysis(경제 매체 인용), 21세기경제보도, V2EX 커뮤니티. 2026년 8월 5일 기준이며, 배포 전 최신 가격·V4-Pro / Harness 상태를 재확인하십시오.
자주 묻는 질문
DeepSeek V4와 V3.2의 가장 큰 차이는 무엇입니까?
100만 token 컨텍스트를 네이티브 지원합니다. 장컨텍스트에서 FLOPs는 V3.2의 27%, KV Cache는 10%만 소모합니다. V4 시리즈는 Agent 능력을 전면 강화하여 Claude Code, OpenCode 등 주류 Agent 도구에 최적화되었습니다.
일상 사용에 V4 Flash와 V4 Pro 중 무엇을 선택해야 합니까?
일반 대화, 배치 처리, Agent 파이프라인은 V4-Flash-0731 정식판(가성비 우수, Agent 벤치마크 Pro 프리뷰 초과)을 우선합니다. 더 깊은 세계 지식·복잡 추론은 V4-Pro 프리뷰를 임시 사용하고 정식판 GA 후 재평가하십시오.
지금 V4 Pro 정식판을 사용할 수 있습니까?
2026년 8월 5일 기준 불가합니다. 정식판은 V4-Flash-0731(API 전용)만 있으며 앱·웹 미동기입니다. V4-Pro 정식판·Harness는 「가능한 한 빨리」 공개 예정이며 「8/10–20」 등 구체 시점은 미확인 루머입니다.
DeepSeek가 공개한 벤치마크를 그대로 믿어도 됩니까?
구분하여 판단하십시오. SWE-bench Verified 등 서드파티 벤치마크는 신뢰도가 높습니다. Terminal Bench 2.0 등 Agent 점수는 미공개 Harness 기준이며 공식도 프레임워크 선택 민감성을 명시합니다. Claude Code·Cursor 독립 재현 후 결론 내리십시오.
프로덕션에서 DeepSeek V4 Agent를 7×24 운영하려면?
전용 Mac 클라우드 호스트에 OpenClaw Gateway 또는 다모델 라우터를 배포하여 노트북 슬립으로 장세션이 끊기는 것을 방지하십시오. MACCOME Mac 대여 요금에서 노드 구성·가격을 확인하십시오.