DeepSeek V4 Flash 정식판 리뷰: 벤치마크 Opus 4.8 근접, 가격은 수십 분의 일

약 16분 소요 · MACCOME · 마지막 업데이트: 2026년 8월 5일

대상 독자: AI 개발자, Agent 엔지니어, API 선정·비용 통제를 담당하는 기업 기술 리더입니다. 2026년 7월 31일 DeepSeek가 V4-Flash를 정식판 0731로 승격했습니다. 파라미터 규모는 불변, 재학습만으로 Agent 벤치마크가 자사 대형 V4-Pro 프리뷰를 초과했으며, 가격은 Claude Opus 4.8의 수십 분의 일 수준입니다. 본문 제공 내용: 전체 타임라인, 5사 가격 비교표, Harness 프레임워크 해설, Artificial Analysis 횡단 비교, 벤치마크 논쟁 경계, 6단계 Runbook입니다. 구성: 페인포인트 → 타임라인 → 가격 매트릭스 → 아키텍처 → 경쟁 구도 → 논점 → Runbook → 결론·전환. 7/20 GA·피크/오프피크 요금은 V4 GA 출시 글을, Kimi K3 비교는 K3 오픈 웨이트 글을 참고하십시오.

bolt

TL;DR — 30초 결론

  • 신규 모델 아님: 284B / 13B 활성 파라미터는 4월 프리뷰와 동일합니다. 성능 향상은 후학습 재실행에서만 발생했습니다.
  • 가격 압도: 입력 $0.14/M(캐시 미스), 출력 $0.28/M — Opus 4.8 대비 약 1/36~1/179(캐시 히트 여부에 따라).
  • Harness 최초 등장: DeepSeek 자체 Agent 프레임워크로 Claude Code에 대응하나 아직 미공개입니다. 공식 Agent 벤치마크는 모두 「minimal mode」 기준입니다.
  • V4-Pro 미GA: 8/5 기준 정식판은 Flash-0731(API 전용)만 존재합니다. Pro 정식판·Harness는 「가능한 한 빨리」 공개 예정입니다.
  • 벤치마크는 신중히: Terminal Bench 2.0 82.7점은 제조사 자체 보고 + 특정 프레임워크 결과입니다. Claude Code / Cursor 등 서드파티 Agent 환경에 그대로 적용하지 마십시오.

6대 페인포인트: Flash 정식판은 왔지만 의사결정 공백은 남아 있습니다

7/31 정식판 GA 이후 기술 팀은 다음 6가지 공백에 막힙니다. 각 항목은 API 청구액과 Agent 품질에 직접 영향을 줍니다.

  1. 벤치마크가 Harness에 의존, 공식도 경고: Terminal Bench 2.0 82.7점은 미공개 Harness minimal mode 기준입니다. Claude Code나 Cursor 범용 능력과 동일시할 수 없습니다.
  2. V4-Pro 정식판 연기: 1.6T 플래그십 정식판 확정일 없음. 「8/10–20 GA」는 미확인 출처 보도이며 changelog는 「가능한 한 빨리」만 명시합니다.
  3. API 전용, 앱 미동기: 0731 정식판은 API 공개 테스트만 해당합니다. 소비자 앱·웹은 구버전 — 다중 채널 혼용 시 경험이 불일치합니다.
  4. 캐시 히트율 낮음: 해외 개발자 커뮤니티에서 입력 캐시 히트율이 이상적이지 않다는 피드백이 있습니다. 배치 Agent 루프 실제 비용이 표시가보다 높을 수 있습니다.
  5. 피크 2배 요금 예고 미적용: 베이징 9–12시·14–18시 피크 2배 요금을 예고했으나 발행 시점 기준 시행일 미공표입니다.
  6. 투자·IPO 루머 미확인: 약 74억 달러 투자·IPO 준비 보도는 「관계자」 인용이며 규제 신고·공식 성명은 없습니다.

타임라인: 4월 프리뷰에서 7월 Flash 정식판까지

시점사건
2026-04-24V4 프리뷰 공개·OSS: V4-Pro(1.6T / 49B 활성), V4-Flash(284B / 13B 활성), 1M 컨텍스트, MIT
2026-07-24구 API deepseek-chat, deepseek-reasoner 영구 중단, V4 시리즈 명명으로 전환
2026-07-27Moonshot Kimi K3(2.8T) 오픈 웨이트 Hugging Face 공개, DeepSeek에 경쟁 압력
2026-07-31V4-Flash-0731 정식판 API 공개 테스트, OSS 가중치 동기 공개; changelog에 자체 Agent 프레임워크 「Harness」 최초 명시
2026-08-02Alibaba Qwen3.8-Max API GA(가중치 대기), 중국 OSS 진영 경쟁 심화
2026-08-05(발행 시점)V4-Pro 정식판 미출시; Harness 미공개; 앱·웹 0731 미동기

핵심 가격 비교: Flash 정식판 vs 중국 OSS 6파전

아래 가격은 제조사 공개 데이터(2026-08-05 기준)이며 「자체 보고」 정보입니다. GLM-5.2 일부 필드는 본문 검증 범위 밖입니다.

모델상태총 파라미터 / 활성컨텍스트입력(미스/히트, $/M)출력($/M)라이선스
V4-Flash-0731정식판284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-Pro프리뷰1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3가중치 OSS2.8T / ~104B(커뮤니티 추정)~1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2OSS~744B / ~40B1M미검증미검증MIT
Qwen3.8-MaxAPI GA2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00OSS 약속
GPT-5.6 Sol폐쇄미공개폐쇄
Claude Fable 5폐쇄미공개1M~$50폐쇄

아키텍처 불변, 후학습 강화: CSA + HCA + mHC + Muon

가장 놓치기 쉬운 핵심은 V4-Flash-0731이 4월 프리뷰와 파라미터·구조가 동일하다는 점입니다. 성능 향상은 재후학습에서만 발생했습니다. 284B 총·13B 활성 Flash가 여러 Agent 벤치마크에서 수 배 큰 V4-Pro 프리뷰를 초과 — 2026년 하반기 「후학습 품질」이 「파라미터 적층」에 추격·초과하는 추세를 뒷받침합니다.

기술 보고서 《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》에 따르면 V4 시리즈 아키텍처 핵심 변경 3가지는 다음과 같습니다.

  • 하이브리드 어텐션(CSA + HCA): 외부 명칭 DSA 희소 어텐션. 장컨텍스트 연산·메모리 절감. 1M 컨텍스트에서 V4-Pro 단 token FLOPs는 V3.2의 27%, KV Cache 10%(제조사 자체 보고, 독립 재현 미확인).
  • 다양체 제약 하이퍼 연결(mHC): 표준 잔차 연결 개선, 깊은 네트워크 신호 안정 전파.
  • Muon 옵티마이저: AdamW 대체, 수렴 속도·안정성 향상.

Harness 프레임워크: DeepSeek의 Claude Code 대응 Agent 실행층

7/31 changelog에 DeepSeek Harness가 최초 공식 등장했습니다. 파일 읽기·쓰기, 도구 호출, 명령 실행, 엔드투엔드 엔지니어링 과제를 처리하는 자체 Agent 실행 프레임워크로 Claude Code에 대응합니다. 이전까지 DeepSeek 모델은 Claude Code, OpenCode 등 서드파티 Agent에 주로 의존했습니다.

공식 Agent 벤치마크(Terminal Bench 2.0, Toolathlon 등)는 전부 Harness minimal mode 기준이며, max 티어·top_p=0.95·temperature=1.0입니다. changelog에서 「벤치마크는 harness 선택에 매우 민감하며 모델 자체 능력 향상과 동일시할 수 없다」고 명시합니다.

Artificial Analysis 횡단 비교: 지능 점수 최고는 아니나 비용은 최저

모델Intelligence Index(서드파티)작업당 평균 비용(서드파티)
V4-Flash-0731DeepSeek50$0.03
Kimi K3Moonshot57$0.86
GLM-5.2智谱/Z.aiFlash 대비 약 +1미검증
GPT-5.6 SolOpenAIFlash 대비 +9 이상$1.86
Claude Fable 5AnthropicFlash 대비 +9 이상$3.15

출처: Artificial Analysis 독립 평가(경제 매체 인용). DeepSeek 자체 Agent 벤치마크(Terminal Bench 2.0 등)와 방법론이 다르며 직접 합산 비교 불가입니다.

역설적 대비: V4-Flash 지능 점수는 Kimi K3·GLM-5.2에 뒤지나 작업당 비용은 Kimi K3의 약 1/29, GPT-5.6 Sol의 1/62, Claude Fable 5의 1/105입니다. DeepSeek는 「1위 벤치마크」가 아니라 「충분한 지능 + 극한 가격」을 겨냥합니다 — 프리뷰가 OpenRouter 7주 연속 1위를 유지한 이유입니다.

논점: 벤치마크는 좋아 보이나 수분 가능성 존재

  • Agent 점수 Harness 의존: Terminal Bench 2.0 82.7점(vs V4-Pro 프리뷰 67.9점)은 미공개 프레임워크 기준. Claude Code·Cursor 독립 재현 전까지 「제조사 자체 + 특정 프레임워크」로 간주하십시오.
  • 가용성 이슈: 21세기경제보도가 인용한 해외 개발자 피드백에 입력 캐시 히트율 저조, 안전 분류기 간헐 타임아웃 등이 보고되었습니다.
  • V4-Pro / Harness 출시 시점 미확인: 「8/10–20 GA」는 미확인 출처. DeepSeek 「가능한 한 빨리」를 기준으로 하십시오.
  • 투자 루머 주의: 약 74억 달러·487억 달러 밸류에이션은 「보도에 따르면」 수준이며 규제 신고로 직접 확인되지 않았습니다.

「참수선」과 커뮤니티 정서: 「梁白开」에서 「梁圣」까지

V4-Pro 연기 기간 중국 AI 커뮤니티는 창립자 梁文锋를 「梁白开」(「白等」)로 농담했습니다. Flash-0731 초과 기대 후 「梁圣」로 되돌아갔습니다. 더 주목할 개념은 「참수선」입니다. DeepSeek가 「충분한 성능 + 극단적 저가」로 시장 문턱을 설정 — 경쟁사가 성능을 뚜렷이 넘기지 못하고 더 낮은 가격을 제시하지 못하면 존재감을 잃을 수 있다는 논의입니다. 동기 OpenAI GPT-5.6 Luna 80% 일괄 인하 등 밀집 가격 조정을 설명합니다(OpenAI 인하 글 참조).

7/31 출시 당일 NVIDIA·Broadcom·AMD 등 연산 주식은 뚜렷한 변동 없었습니다 — 2025년 초 DeepSeek-R1로 글로벌 AI 칩주 하락을 촉발한 것과 대조적이며, 시장은 「DeepSeek식 효율 돌파」 내러티브에 익숙해진 것으로 해석됩니다.

6단계 Runbook: 평가에서 프로덕션 라우팅까지

  1. 모델 포인터 확인: API deepseek-v4-flash는 0731 정식판을 자동 가리킵니다. 중단된 deepseek-chat 사용 시 즉시 전환하십시오(마이그레이션은 GA 마이그레이션 가이드).
  2. Staging 품질 비교: 실제 Prompt 부분집합으로 0731 vs 프리뷰 출력 비교. Agent 도구 호출 형식·장컨텍스트 안정성에 집중하십시오.
  3. Flash / Pro 계층 라우팅: 배치·라우팅은 Flash($0.28/M 출력). 복잡 추론은 V4-Pro 프리뷰 임시 사용, 정식판 GA 후 재평가.
  4. 캐시 히트율 모니터링: 고정 System Prompt Agent 루프에 Prompt Cache 활성화. 히트율 저조 시 실제 비용이 표시가보다 크게 증가합니다.
  5. 피크/오프피크 스케줄 예약: 비실시간 배치는 예고된 피크(베이징 9–12·14–18) 외 시간대에 실행하십시오.
  6. 로컬 vs 클라우드 결정: 128GB Mac은 ds4로 Flash q2 양자화 실행 가능. 프로덕션 Agent는 7×24 상주 노드 필요 — ds4 로컬 vs 클라우드 대여 결정 글 참조.
python
from openai import OpenAI

client = OpenAI(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)

# deepseek-v4-flash는 0731 정식판을 자동 가리킴
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "이 Agent 로그를 분석해 주세요..."}],
)

인용할 3대 핵심 데이터

  • 82.7 vs 67.9 — Terminal Bench 2.0: V4-Flash-0731 제조사 자체 점수가 V4-Pro 프리뷰 초과(Harness minimal mode, 독립 재현 대기)
  • 27% / 10% — 1M 컨텍스트에서 V4-Pro FLOPs·KV Cache가 V3.2 대비 비율(DeepSeek 기술 보고서 자체 보고)
  • 1/29 ~ 1/105 — V4-Flash 작업당 비용 대 Kimi K3 / GPT-5.6 Sol / Claude Fable 5 배수(Artificial Analysis 서드파티)

결론: 충분한 지능 + 극한 가격, 그러나 프로덕션 Agent에는 안정적 기반이 필요합니다

DeepSeek V4-Flash-0731의 가치는 Claude Fable 5나 GPT-5.6 Sol의 절대 지능 상한을 능가하는 것이 아닙니다. 폐쇄 플래그십 1/36~1/179 가격으로 대규모 Agent·배치에 「충분한」 OSS 선택지를 제공하는 데 있습니다. 예산 민감·프라이빗 배포·고빈도 호출 팀에게 Flash 정식판은 현재 가성비 최상위 옵션 중 하나입니다.

그러나 프로덕션에서 DeepSeek V4 Agent 워크플로(OpenClaw Gateway, Harness 향후 연동, 다모델 하이브리드 라우팅)를 안정 운영하려면 3가지 구조적 병목이 있습니다.

  • 노트북 슬립 중단: 덮개·Wi-Fi 전환 시 장시간 Agent 세션 단절, 소비 토큰 환불 불가;
  • 캐시·피크 스케줄 미실행: 로컬 Cron은 슬립 정책 영향, 비피크 배치를 신뢰 실행 불가;
  • 7×24 라우팅 허브 부재: Flash / Pro / Fable 5 혼합 전략은 상주 Gateway가 과제 유형별 분배 필요, 노트북은 스케줄링 노드에 부적합.

DeepSeek V4 + 다모델 Agent 하이브리드 스택을 안정 운영하려면 MACCOME Mac 클라우드 호스트가 실제 macOS, SSH 인수, 격리 환경을 제공하여 Agent가 전용 노드에서 7×24 실행됩니다. 공개 요금은 Mac mini 대여 가격을 참고하십시오.

데이터 출처: DeepSeek 공식 API 문서·changelog, 기술 보고서, Hugging Face 모델 카드, Artificial Analysis(경제 매체 인용), 21세기경제보도, V2EX 커뮤니티. 2026년 8월 5일 기준이며, 배포 전 최신 가격·V4-Pro / Harness 상태를 재확인하십시오.

자주 묻는 질문

DeepSeek V4와 V3.2의 가장 큰 차이는 무엇입니까?

100만 token 컨텍스트를 네이티브 지원합니다. 장컨텍스트에서 FLOPs는 V3.2의 27%, KV Cache는 10%만 소모합니다. V4 시리즈는 Agent 능력을 전면 강화하여 Claude Code, OpenCode 등 주류 Agent 도구에 최적화되었습니다.

일상 사용에 V4 Flash와 V4 Pro 중 무엇을 선택해야 합니까?

일반 대화, 배치 처리, Agent 파이프라인은 V4-Flash-0731 정식판(가성비 우수, Agent 벤치마크 Pro 프리뷰 초과)을 우선합니다. 더 깊은 세계 지식·복잡 추론은 V4-Pro 프리뷰를 임시 사용하고 정식판 GA 후 재평가하십시오.

지금 V4 Pro 정식판을 사용할 수 있습니까?

2026년 8월 5일 기준 불가합니다. 정식판은 V4-Flash-0731(API 전용)만 있으며 앱·웹 미동기입니다. V4-Pro 정식판·Harness는 「가능한 한 빨리」 공개 예정이며 「8/10–20」 등 구체 시점은 미확인 루머입니다.

DeepSeek가 공개한 벤치마크를 그대로 믿어도 됩니까?

구분하여 판단하십시오. SWE-bench Verified 등 서드파티 벤치마크는 신뢰도가 높습니다. Terminal Bench 2.0 등 Agent 점수는 미공개 Harness 기준이며 공식도 프레임워크 선택 민감성을 명시합니다. Claude Code·Cursor 독립 재현 후 결론 내리십시오.

프로덕션에서 DeepSeek V4 Agent를 7×24 운영하려면?

전용 Mac 클라우드 호스트에 OpenClaw Gateway 또는 다모델 라우터를 배포하여 노트북 슬립으로 장세션이 끊기는 것을 방지하십시오. MACCOME Mac 대여 요금에서 노드 구성·가격을 확인하십시오.