리드: 8월 12일부터 17일까지 닷새 동안 중국 LLM 진영은 서로 모순되면서도 맞물리는 세 수를 두었습니다. DeepSeek는 API를 피크 기준 최대 약 1,100% 인상한다고 밝혔고, 알리바바는 한 번도 공개하지 않았던 Qwen-Max급 플래그십 2.4조 파라미터 가중치를 풀었으며, 지푸는 동일 7430억 베이스를 재학습하지 않고 후학습만으로 코딩 벤치마크를 수 배 끌어올렸습니다. 본문은 타임라인, 요금표, 라이선스 조항, 벤치마크를 교차 대조해 「가격 경쟁에서 가격 결정권 경쟁으로」라는 축을 정리하고, 청구서 시산과 선정 절차를 제공합니다. 도입 후 이득은 헤드라인 퍼센트가 아니라 피크 회피·캐시 히트·오픈웨이트 자체 추론을 상주 노드에 고정했을 때 나옵니다. V4 정식판과 피크/비피크 과금 배경은 DeepSeek V4 GA 마이그레이션 가이드, Qwen 공개 창은 Qwen3.8-Max 출시 해설을 참고하십시오.
한 줄 결론: 세 회사, 세 가지 수법은 같은 신호를 가리킵니다. 중국 LLM은 「가격을 깎는 경쟁」에서 「가격을 정하는 경쟁」으로 넘어가고 있습니다. 본문 가격·라이선스·점수는 공개 공고를 교차 확인했습니다. 칩 서비스, Cursor 취약점, 수출 규제 소문은 독립 검증 전으로 따로 표시합니다.
헤드라인 숫자는 큽니다. 그러나 Agent를 돌리고, 오픈웨이트를 평가하고, API 청구서를 쪼개는 팀에게 결정을 막는 것은 아래 사각입니다. 도입 후 비용·운영 이득은 이 여섯 줄을 먼저 고정해야 나타납니다.
시야를 조금 넓힙니다. 7월 30일 OpenAI는 가장 저가 등급인 GPT-5.6 Luna를 80% 인하했고, 8월 6–7일에는 Luna를 무료 사용자 기본 모델로 두고 무제한 텍스트 대화를 열었습니다. 중국 벤더가 인상과 오픈에 더하는 바로 그 시각, 미국 벤더는 무료와 인하에 더하고 있습니다. 우연이 아니라 같은 가격 게임의 양면입니다. Luna 조정 세부는 GPT-5.6 인하 분해를 참고하십시오.
| 날짜 | 사건 |
|---|---|
| 7월 16일 | 문샷(월지암면) Kimi K3(2.8조 파라미터) 오픈. 이미 미측 안보 관심을 유발한 상태 |
| 8월 2일–3일 | 알리바바 Qwen3.8-Max 예고 후 클라우드 API 출시 |
| 8월 10일 | Meta 오픈 모델 Muse Glimmer(300억 파라미터, Apache 2.0) 공개. 플래그십 Muse Spark 1.2 가중치 「곧 오픈」 예고 |
| 8월 12일 | 알리바바 ModelScope / Hugging Face에 Qwen3.8-2.4T-A95B 오픈웨이트 공개. 같은 날 xAI Grok 4.6 발표 |
| 8월 13일 | DeepSeek-V4-Pro 정식판 출시, 8월 17일부터 API 인상 공고. 구글은 반값 Gemini 3.7 Flash 발표 |
| 8월 14일 | 지푸 GLM-5.3 발표. GLM-5.2와 같은 7430억 파라미터 베이스 유지 |
| 8월 17일 0시(베이징 시간) | DeepSeek 새 요금 정식 발효 |
단위는 100만 토큰당입니다. 캐시 히트 입력의 상승률이 가장 큽니다(최대 약 12배 / 1,100%+). 다만 절대 금액은 여전히 작습니다. 헤비 호출자에게 더 크게 남는 것은 출력(350%)과 캐시 미스 입력입니다. 피크를 비피크로 옮기고 히트율을 올리면, 도입 직후 청구 곡선이 헤드라인과 갈라집니다.
| 과금 항목(100만 토큰당) | 인상 전 | 비피크(신규) | 피크(신규) | 상승률(피크) |
|---|---|---|---|---|
| V4-Flash 캐시 히트 입력 | ¥0.02 | ¥0.05 | ¥0.10 | 약 400% |
| V4-Flash 캐시 미스 입력 | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash 출력 | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro 캐시 히트 입력 | ¥0.025 | ¥0.15 | ¥0.30 | 약 1100% |
| V4-Pro 캐시 미스 입력 | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro 출력 | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
데이터 출처: DeepSeek 공식 공고를 WallstreetCN, IT Home, V2EX 등과 교차 확인했습니다. 헤드라인 「1100%」는 피크 캐시 히트 입력에만 대응합니다. 출력 350%가 다수 실제 청구의 주항입니다.
알리바바 역사상 처음으로 Max급(플래그십) 모델을 오픈한 사례입니다. 이전 Qwen3.5 / 3.6 / 3.7 Max는 모두 클로즈드 API였습니다. 가중치를 받으면 자체 추론 단가를 공식 API와 분리할 수 있고, 라이선스 문턱만 넘지 않으면 운영 이득이 바로 청구서에 남습니다.
| 항목 | 데이터 |
|---|---|
| 파라미터 규모 | 총 2.4조, 활성 950억(MoE, 전문가 512, 라우팅 10 + 공유 1) |
| 컨텍스트 윈도 | 오픈웨이트 네이티브 262,144 토큰, 약 101만까지 확장 가능. 클라우드 Max 기본 100만 토큰 |
| 공개 리듬 | 8월 2일 예고 → 8월 3일 API 출시 → 8월 12일 오픈웨이트 |
| API 가격(국제 사이트) | 입력 $2 / M tokens, 출력 $6 / M tokens |
| 라이선스 | Apache 2.0 아님. 커스텀 「Qwen3.8-Max License」 |
| 의미 | 알리바바 역사상 첫 Max급 플래그십 오픈 |
아래는 지푸 공식 자체 측정이며, 독립 제3자 재측정은 아직 없습니다. GLM-5.3은 Terminal-Bench 3.0에서 여전히 GPT-5.6 Sol(34.6%)과 Claude Fable 5(33.7%)에 뒤집니다. 전면 정상이 아니라 「오픈 모델 1군」입니다. 전량 전환보다 소량 대조가 운영 리스크를 낮춥니다.
| 벤치마크 | GLM-5.2 | GLM-5.3 | 변화 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 |
| Agents' Last Exam(CLI) | 23.8% | 28.5% | +4.7 |
| CyberGym | 77.2% | 84.5% | +7.3 |
| AutomationBench | 26.2% | 48.2% | +22.0 |
이번 인상을 「따라 올리기」로 읽기 쉽습니다. 구조를 보면 연산 청구서를 투명화한 쪽에 가깝습니다. 그동안 DeepSeek는 시간대를 나누지 않는 일률 저가를 오래 유지했습니다. 저가로 사용자를 모으고, 캐시 히트율과 피크 회피 스케줄로 원가를 나누는 모델입니다. 호출량이 지수로 늘고 GPU 공급이 따라가지 못하면 이 구조는 버티지 못합니다. 인상 공고의 「더 유연한 워크로드 스케줄을 권장한다」는 문장은, 「연산이 모자라니 직접 피크를 피하라」로 번역됩니다.
인상 후 DeepSeek 공식 API 가격은 피크에서 일부 서드파티 재판매(GMI Cloud, Novita 등 현 호가는 공식 피크보다 낮을 수 있음)를 역전합니다. 「공식이 가장 싸다」는, DeepSeek 해자를 받치던 가정이 처음 깨진 지점입니다. 도입 후 이득은 공식만 고집하지 않고, 피크는 재판매·대체 모델, 비피크는 공식+캐시로 나누는 라우팅에서 나옵니다.
Qwen3.8-Max 오픈은 단순한 기부가 아닙니다. 알리바바는 동시에 두 가지를 했습니다. 2.4조 파라미터 가중치를 공개 다운로드로 풀고, 그 가중치에 기존 Apache 2.0과 다른 커스텀 라이선스를 붙였습니다. 과거 12개월 해당 사업 매출이 5,000만 달러를 넘는 「모델 애즈 어 서비스」 또는 「AI 업무 비서」는 알리바바와 별도 상업 인가를 논의해야 합니다. MAU 1억 초과 또는 월 매출 2,000만 달러 초과 제품은 화면에 모델명을 눈에 띄게 표시해야 합니다.
조합의 논리는 명확합니다. 오픈으로 개발자 생태계와 평판을 사고(특히 해외 개발자, 「국산 모델은 무대에 못 오른다」는 인상을 완화), 실제 현금흐름이 나오는 대형 고객에게는 협상권을 남깁니다. 그래서 Meta Muse Glimmer(완전 Apache 2.0, 부가 조항 없음)와 「오픈 정도」가 같은 급이 아닙니다. Kimi K3 오픈웨이트 문턱 대조는 Kimi K3 전면 오픈 해설을 참고하십시오.
널리 퍼진 루머를 바로잡습니다. 알리바바 라이선스가 미국·EU·영국·한국 사용자 다운로드를 금지한다는 말은 사실이 아닙니다. 공식 라이선스 원문에 지역 제한 조항은 없습니다. 이런 루머는 원문을 한 번 읽는 속도보다 빨리 돕니다. 정보원을 의심하는 편이 컴플라이언스 비용보다 쌉니다.
GLM-5.3에서 점수 자체보다 중요한 것은 「어떻게 그 점수를 냈는가」입니다. 베이스는 GLM-5.2와 완전히 같습니다(7430억 파라미터). 재사전학습은 없고, 강화학습 환경 규모만 키운 후학습으로 Terminal-Bench 3.0을 4.6%에서 28.3%로, 약 6배 가까이 올렸습니다. 최근 반년 업계에서 선명해진 추세를 확인합니다. 사전학습 Scaling Law의 한계 수익이 둔해지면 「후학습 강화학습 규모화」가 새 성능 레버가 됩니다. 이 레버의 문턱은 천억급 베이스를 다시 학습하는 것보다 뚜렷이 낮고, 중견 벤더도 「정밀 시공」으로 1군을 따라갈 여지가 생깁니다. 도입 후 운영 이득은 전량 교체가 아니라, 같은 베이스를 유지한 채 후학습 체크포인트만 갈아끼우는 배포 비용에서 나옵니다.
환산은 약 ¥7.15 / $1로 어림합니다. 참고용이며 실제는 공식 공고가 우선입니다. 인상 후 DeepSeek V4-Pro 비피크는 여전히 Claude Opus 5보다 뚜렷이 낮습니다. 그러나 「전 구간 최저」는 아닙니다. 알리바바 국제 사이트 Qwen3.8-Max, OpenAI Luna가 DeepSeek 비피크보다 쌉니다. 「국산 = 가장 싸다」는 등식이 무너지고, 가격 경쟁은 계층 단계로 들어갑니다. 계층을 라우팅에 반영하면 도입 후 단가가 한 모델에 묶이지 않습니다.
| 모델 | 입력 가격(100만 토큰당) | 출력 가격(100만 토큰당) | 오픈 정도 |
|---|---|---|---|
| DeepSeek V4-Pro(피크) | ¥9.0(약 $1.26) | ¥27.0(약 $3.78) | 가중치 미오픈 |
| DeepSeek V4-Pro(비피크) | ¥4.5(약 $0.63) | ¥13.5(약 $1.89) | 가중치 미오픈 |
| Qwen3.8-Max(국제 사이트) | $2 | $6 | 오픈(커스텀 라이선스) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | 클로즈드 |
| Claude Opus 5(알리바바 공개 배수 관계로 추산) | 약 $5 | 약 $25 | 클로즈드 |
더 큰 서사에 넣으면, 지난 한 달 중국 선두 모델 벤더는 「일주일에 세 번 갱신」에 가까운 밀도입니다. DeepSeek, 알리바바, 지푸 외에 문샷 Kimi K3(7월 16일, 2.8조 파라미터 오픈), MiniMax H3 등이 번갈아 등장했습니다. 국내 경제 매체는 이 현상을 「중국 오픈 모델의 밀집 공개가 글로벌 AI 업계 가격 재설정을 압박한다」로 읽습니다.
동시에 미국 벤더는 다른 경로를 갑니다. OpenAI는 7월 30일 대폭 인하(Luna −80%)하고, 8월 6–7일 인하된 Luna를 무료 사용자 기본 모델로 두며 무제한 텍스트 대화를 열었습니다. 구글은 8월 13일 가격을 반으로 낮춘 Gemini 3.7 Flash를 냈습니다. 중국 벤더는 「플래그십 오픈 + 계단 인상」, 미국 벤더는 「소비자 쪽 무료 + 인하 방어」입니다. 두 경로가 동시에 일어나 2026년 8월을 LLM 업계 가격 논리 재구성의 분기점으로 만듭니다.
다른 층은 지정학입니다. 문샷 Kimi K3 오픈은 이미 미측 안보 심사를 불렀고, 알리바바가 이 창에 2.4조 파라미터 플래그십을 오픈한 것을 일부 분석은 「잠재 규제 강화 전에 국산 모델의 국제 영향력과 기술 대등 서사를 먼저 굳힌다」로 읽습니다. 추측이 섞인 판단이지만, 이번 오픈 파도의 시점 선택에서 빼기 어려운 배경입니다.
헤드라인 퍼센트에 끌리지 마십시오. 아래 여섯 단계로 「더 비싸지나」를 실행 가능한 청구와 라우팅 결정으로 내립니다. 도입 후 이득은 피크 비중을 낮추고, 오픈웨이트 추론과 감사 로그를 상주 노드에 고정할 때 누적됩니다.
# DeepSeek V4-Pro 어림: 「피크 vs 비피크」가 출력 항에 미치는 영향만 시연
# 가격은 2026-08-17 발효 요금(위안 / 100만 토큰)
PEAK_OUT, OFF_OUT = 27.0, 13.5
def monthly_output_bill(out_tokens_m, peak_share):
peak = out_tokens_m * peak_share * PEAK_OUT
off = out_tokens_m * (1 - peak_share) * OFF_OUT
return round(peak + off, 2)
print(monthly_output_bill(10, 0.8)) # 피크 80% → ¥243.0
print(monthly_output_bill(10, 0.2)) # 피크 20% → ¥162.0
8월 닷새는 세 일을 한 요금표에 겹쳤습니다. DeepSeek는 피크/비피크로 연산 부족을 청구서에 썼고, 알리바바는 오픈웨이트로 생태계를 사고 커스텀 라이선스로 협상권을 남겼으며, 지푸는 후학습으로 「정밀 시공」도 1군을 따라갈 수 있음을 보였습니다. Agent와 오픈웨이트를 돌리는 팀에게 흔한 세 가지 구조 병목은 그대로입니다.
피크 회피 스케줄, 오픈웨이트 추론, API 청구 감사를 안정적이고 격리 가능한 프로덕션 토폴로지에 두려면 MACCOME Mac 클라우드 호스트가 실제 macOS, SSH 인수, 네트워크 경계를 통제할 수 있는 환경을 제공합니다. 7×24 상주에 맞습니다. 공개 플랜은 Mac mini 클라우드 대여 가격에서 확인하십시오.
데이터 출처: DeepSeek 공식 인상 공고를 WallstreetCN, IT Home, AIGC 도구 내비게이션, V2EX 커뮤니티 논의와 교차 확인했습니다. 알리바바 Qwen 공식 모델 저장소(Hugging Face / ModelScope)와 사우스차이나모닝포스트(SCMP) 라이선스 조항 보도, 지푸(Z.ai) GLM-5.3 공식 기술 페이지와 VentureBeat·StableLearn 관련 보도, Meta AI Research 공식 블로그와 VentureBeat의 Muse Glimmer 보도, 제일재경·소후재경 등 중국 LLM 밀집 공개 리듬 종합 보도를 참고했습니다. 이상 데이터는 발행 전 공개 정보를 정리한 것이며, 가격·라이선스 조항·벤치마크 점수는 게시 전 최신 공식 공고를 다시 확인하는 것을 권합니다. 칩 서비스, 보안 취약점 발견, 수출 규제 소문은 본문에서 독립 검증 전 정보로 표시했습니다.
자주 묻는 질문
DeepSeek 인상 이후 실제 청구서는 반드시 더 비싸집니까?
시나리오를 나눠 봐야 합니다. 호출이 대부분 비피크(베이징 시간 9–12시, 14–18시 이외)에 떨어지고 캐시 히트율이 높은 헤비 사용자라면, 표면의 「350%」「1100%」 헤드라인보다 실제 청구 상승은 뚜렷이 낮습니다. 일부 분석은 헤비 사용자 실제 청구 상승을 약 1.8배로 시산합니다. 반대로 피크에 몰리고 캐시 히트율이 낮으면 헤드라인에 가깝거나 도달합니다. 피크 회피 배치와 7×24 스케줄이 필요하면 MACCOME Mac 클라우드 대여 가격에서 상주 노드를 확인하십시오.
알리바바가 공개한 Qwen3.8-Max를 개인 개발자가 무료로 상업 이용할 수 있습니까?
개인 개발자와 내부 사용은 대체로 영향이 없습니다. 다만 사업이 「모델 애즈 어 서비스」 또는 「AI 업무 비서」류이고, 과거 12개월 해당 사업 누적 매출이 5,000만 달러를 넘으면 알리바바에 별도 상업 라이선스를 신청해야 합니다. 제품 MAU가 1억을 넘거나 월 매출이 2,000만 달러를 넘으면 화면에 모델명을 눈에 띄게 표기해야 합니다.
GLM-5.3과 GLM-5.2는 같은 모델입니까? 왜 갑자기 강해졌습니까?
기저 베이스는 완전히 같습니다(7430억 파라미터). 지푸는 재사전학습을 하지 않았습니다. 점수가 크게 오른 이유는 후학습 단계에서 강화학습 환경 규모를 대폭 키웠기 때문입니다. 현 단계에서 「후학습 규모화」 자체가 독립적이고 유효한 성능 레버이며, 더 큰 베이스를 다시 사전학습할 필요는 없습니다.
Qwen3.8-Max 라이선스가 미국·EU 사용자 다운로드를 금지한다는 소문은 사실입니까?
사실이 아닙니다. 온라인에 퍼진 부정확한 정보입니다. 공식 라이선스 원문에는 지역 제한 조항이 없으며, 주요 제한은 특정 매출 규모를 넘는 상업 서비스에 대한 것입니다. 사용자 소재 지역과는 무관합니다.
Meta의 Muse Glimmer 공개는 Llama 시대 오픈소스 정신의 복귀입니까?
지금은 「부분 복귀」에 가깝습니다. Muse Glimmer 자체는 300억 파라미터 증류 소형 모델입니다. Meta의 실제 플래그십 클로즈드 모델 Muse Spark 1.2는 아직 오픈되지 않았고, 저커버그는 향후 가중치 공개를 「예고」한 상태입니다. 이 단계가 실제로 실현되면 미국 벤더가 플래그십 클로즈드를 오픈으로 전환한 첫 사례가 됩니다. 지금은 후속 진행을 계속 봐야 합니다.