Почему DeepSeek поднял цены API до 1100% — сразу после китайского open-weight блица?

~20 мин чтения · MACCOME · Обновлено: 17 августа 2026

Лид. С 12 по 17 августа три китайских вендора сдвинули сразу три рычага: DeepSeek ввёл пик/внепик и поднял API до ~1100% на cache-hit входе V4-Pro; Alibaba выложила веса флагмана Qwen3.8-Max на 2,4 трлн параметров; Zhipu на том же базисе 743 млрд разогнала GLM-5.3 только пост-тренингом RL. Ниже — таймлайн, тарифы cache hit/miss, лицензия, самотесты и маршрутизация счёта. Фон V4 и пикового окна: гайд по миграции DeepSeek V4 GA. Окно релиза Qwen: разбор Qwen3.8-Max.

warning

Рабочий вывод: три схемы — пиковый биллинг, открытые веса с кастомной лицензией, RL без нового pretrain — бьют в одну точку: право назначать цену, а не гонку «кто дешевле на миллион токенов». Цены, лицензия и бенчмарки сверены с публичными анонсами. Чип Zhenwu M890, «уязвимость Cursor» и слух MOFCOM помечены как непроверенные независимо.

Шесть болей: после заголовка «+1100%» команде надо считать не процент, а строку биллинга

Заголовочная цифра громкая. Для команды, которая крутит агентов, оценивает open-weight и режет API-счёт, решение ломается на шести местах, где механизм и процент расходятся:

  1. Три разных 1100%. «В 11 раз», «свыше 1100%» и «+350%» одновременно верны: cache-hit вход, output и cache-miss вход. Смешать строки — значит заложить бюджет на чужой рычаг.
  2. Пиковое окно Пекина. 9–12 и 14–18 по пекинскому времени — новый peak window. Один и тот же workload, сдвинутый на ночь, режет output-строку вдвое: ¥27 против ¥13,5 / млн токенов на V4-Pro.
  3. «Официал всегда дешевле» больше не держится. В пике официальный DeepSeek уже может быть дороже ресейла (GMI Cloud, Novita на момент сверки ниже официального пика).
  4. Open-weight ≠ Apache 2.0. Qwen3.8-Max идёт под кастомной лицензией: MaaS / AI-помощник с выручкой >$50 млн за 12 месяцев требует отдельного коммерческого договора.
  5. Геозапрет разгоняется быстрее текста лицензии. В оригинале нет бана на США / ЕС / Великобританию / Корею. Поверить слуху — значит неверно оценить compliance.
  6. Самотест ≠ сигнал на полный cutover. Скачок GLM-5.3 на Terminal-Bench — вендорский прогон без независимой перепроверки; модель всё ещё позади Sol 34,6% и Fable 5 33,7%.

Что произошло: две недели на одной шкале

Отъехать на месяц назад: 30 июля OpenAI срезал самый дешёвый ярус GPT-5.6 Luna на 80%, 6–7 августа сделал Luna дефолтом для бесплатных аккаунтов и открыл безлимитный текст. Китайские вендоры в те же дни добавляют цену и веса; американские — режут цену и раздают квоту. Это две стороны одной игры за throughput и право биллинга, а не «две индустрии». Детали Luna: разбор снижения цен GPT-5.6.

ДатаСобытие
16 июляMoonshot открывает веса Kimi K3 (2,8 трлн параметров); ранее уже вызывал интерес американских регуляторов
2–3 августаAlibaba сначала тизерит Qwen3.8-Max, затем поднимает облачный API
10 августаMeta выпускает Muse Glimmer (30 млрд, Apache 2.0) и обещает веса флагмана Muse Spark 1.2; Spark 1.2 всё ещё закрыт
12 августаAlibaba выкладывает веса Qwen3.8-2.4T-A95B на ModelScope / Hugging Face; в тот же день xAI выпускает Grok 4.6
13 августаDeepSeek-V4-Pro GA и анонс повышения с 17 августа; Google режет Gemini 3.7 Flash вдвое
14 августаZhipu выпускает GLM-5.3 на том же базисе 743 млрд, что и GLM-5.2
17 августа, 00:00 (Пекин)Новые тарифы DeepSeek вступают в силу

Цифры: тарифы DeepSeek, спецификация Qwen, самотесты GLM

Тарифы DeepSeek с 17 августа 00:00 по Пекину (пик: 9–12 и 14–18)

Единица — юань за миллион токенов. Максимальный процент сидит на cache-hit входе (до ~12× / 1100%+), но абсолют там крошечный. На тяжёлом трафике счёт двигают output (+350%) и cache-miss вход. Cache hit дешёв, потому что KV уже в памяти; miss платит полный проход префилла. Пик удваивает обе строки относительно внепика: scheduler явно продаёт дефицит GPU, а не «бренд».

Строка биллинга (за млн токенов)До повышенияВнепик (новый)Пик (новый)Рост (пик)
V4-Flash, cache hit (вход)¥0,02¥0,05¥0,10~400%
V4-Flash, cache miss (вход)¥1,0¥1,5¥3,0200%
V4-Flash, выход¥2,0¥4,5¥9,0350%
V4-Pro, cache hit (вход)¥0,025¥0,15¥0,30~1100%
V4-Pro, cache miss (вход)¥3,0¥4,5¥9,0200%
V4-Pro, выход¥6,0¥13,5¥27,0350%
info

Источник строк: официальный анонс DeepSeek, сверка с Wallstreetcn, IT Home, V2EX. Заголовочные 1100% — только cache-hit вход V4-Pro в пике. Output +350% — типичный основной вес реального счёта.

Qwen3.8-2.4T-A95B (открытые веса Qwen3.8-Max): что именно выложили

Впервые Alibaba открывает Max-класс. Предыдущие Qwen3.5 / 3.6 / 3.7 Max оставались закрытым API. MoE здесь важнее заголовка «2,4 Т»: 512 экспертов, 10 маршрутизируемых + 1 общий — в инференсе живёт не полная матрица, а ~95 млрд активных параметров на токен. Throughput и VRAM считаются от активного слоя, не от каталожных 2,4 Т.

ПараметрЗначение
Масштаб2,4 трлн всего, 95 млрд активных (MoE, 512 экспертов, 10 routed + 1 shared)
КонтекстВеса: 262 144 токенов нативно, расширение ~1,01 млн; облачный Max: 1 млн
Ритм релиза2 августа тизер → 3 августа API → 12 августа веса
API (международный стенд)вход $2 / млн токенов, выход $6 / млн
Лицензияне Apache 2.0; кастомная «Qwen3.8-Max License»
Порог коммерцииMaaS / AI-помощник >$50 млн / 12 мес. — отдельный договор; 100 млн MAU или $20 млн / мес. — явное имя модели в UI
Геозапретв тексте лицензии отсутствует (слух о бане США/ЕС — ложный)

GLM-5.3 против GLM-5.2: тот же базис 743 млрд, только пост-тренинг

Ниже — самотест Zhipu, независимой перепроверки нет. На Terminal-Bench 3.0 GLM-5.3 всё ещё позади GPT-5.6 Sol (34,6%) и Claude Fable 5 (33,7%). Это не «вершина рынка», а скачок внутри открытого эшелона за счёт масштаба RL-среды, без нового pretrain.

БенчмаркGLM-5.2GLM-5.3Дельта
Terminal-Bench 3.04,6%28,3%+23,7
DeepSWE v1.146,2%66,9%+20,7
Agents' Last Exam (CLI)23,8%28,5%+4,7
CyberGym77,2%84,5%+7,3
AutomationBench26,2%48,2%+22,0

Три стратегии: пиковый биллинг, лицензия на веса, RL как рычаг

1. DeepSeek: от плоской цены к окну 9–12 / 14–18 — дефицит GPU, записанный в счёт

Повышение легко прочитать как «все подняли — и мы». Структура тарифа говорит иначе. Раньше DeepSeek держал одну низкую цену без окна: масштаб пользователей покупался дешевизной, себестоимость размазывалась cache hit и ночным сдвигом. Когда вызовы растут быстрее поставки GPU, плоская цена перестаёт сходиться. Фраза анонса про «более гибкое планирование нагрузки» читается прямо: пик забит, сдвиньте батч сами.

Механика строк. Cache hit (¥0,30 в пике на Pro) дёшев, потому что префилл уже в KV; headline 1100% бьёт сюда, потому что база была ¥0,025. Cache miss (¥9 в пике) — полный префилл. Output (¥27 в пике) — decode, самый дорогой по GPU-времени токен. Тяжёлый агент с длинным ответом платит output, не headline. Реалистичный рост такого счёта около 1,8×, если часть трафика уезжает во внепик и cache hit остаётся высоким.

В пике официальный API уже может проигрывать ресейлу: котировки GMI Cloud и Novita на сверке ниже официального пика. Гипотеза «официал = минимум» сломалась в первый раз.

2. Alibaba: веса в публичный репозиторий, денежный поток — в кастомную лицензию

Открытие 2,4 Т — не «благотворительность». Alibaba делает две вещи сразу: веса Qwen3.8-2.4T-A95B можно скачать; лицензия не Apache 2.0. MaaS или AI-помощник с выручкой направления >$50 млн за 12 месяцев идёт на отдельный коммерческий договор. Продукт с 100 млн MAU или $20 млн выручки в месяц обязан явно показать имя модели. Экосистема и репутация (в том числе у зарубежных разработчиков) покупаются весами; право торговаться на крупном кэше остаётся у вендора.

По степени открытости это другой класс, чем Muse Glimmer (Apache 2.0, 30 млрд, без доп. порогов). Порог Kimi K3 для сравнения: разбор полного open-weight Kimi K3.

Отдельный слух: лицензия якобы запрещает скачивание из США, ЕС, Великобритании и Кореи. В официальном тексте территориального запрета нет. Ограничения завязаны на выручку и UI-атрибуцию, не на гео. Слух бежит быстрее, чем чтение LICENSE.

3. Zhipu GLM-5.3: базис не меняют, меняют рецепт пост-тренинга

Интересен не сам балл, а способ его получить. Базис GLM-5.3 = GLM-5.2 = 743 млрд, повторного pretrain нет. Zhipu расширила RL-среду на пост-тренинге и подняла Terminal-Bench 3.0 с 4,6% до 28,3% — почти 6× на одном базисе. Когда предельная отдача pretrain-scaling падает, масштабирование RL на пост-тренинге становится отдельным рычагом: порог входа ниже, чем новый базис на сотни миллиардов. Отсюда и оговорка: это самотест, Sol 34,6% и Fable 5 33,7% всё ещё выше, полный cutover по одной таблице — ошибка маршрутизации.

Сравнение после повышения: остался ли DeepSeek «самым дешёвым флагманом»?

Курс для перевода — ¥7,15 / $1, ориентир, не фикс казначейства. Внепик V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не минимум поля: международный Qwen3.8-Max ($2 / $6) и GPT-5.6 Luna ($0,20 / $1,20) дешевле внепика DeepSeek. Уравнение «китайская модель = самая дешёвая» расслоилось: пик, внепик, hosted open-weight и consumer-free — разные полки.

МодельВход (за млн токенов)Выход (за млн токенов)Открытость весов
DeepSeek V4-Pro (пик)¥9,0 (~$1,26)¥27,0 (~$3,78)веса закрыты
DeepSeek V4-Pro (внепик)¥4,5 (~$0,63)¥13,5 (~$1,89)веса закрыты
Qwen3.8-Max (международный стенд)$2$6открыты (кастомная лицензия)
OpenAI GPT-5.6 Luna$0,20$1,20закрыты
Claude Opus 5 (оценка по кратности, раскрытой Alibaba)~$5~$25закрыты

Споры и строки, которые нельзя класть в runbook без пометки

  • Калибр процентов. «×11», «>1100%», «+350%» — все три верны и относятся к разным строкам (cache-hit вход / output / cache-miss вход). Читать заголовок без имени строки бессмысленно.
  • Zhenwu M890. Ряд китайских деловых СМИ пишет, что часть инференса Qwen3.8-Max идёт на чипе Zhenwu M890 и суперноде «Pangu AL128». Деталь есть только в пересказах, без отдельного техдока Alibaba и без стороннего бенчмарка. Пометка: не проверено независимо.
  • «Уязвимость Cursor». Сюжет из VentureBeat и комментариев Zhipu; детали бага не раскрыты, независимой security-лаборатории нет. Пометка: односторонняя заявка вендора.
  • Слух MOFCOM. Часть материалов предполагает ответные экспортные ограничения КНР по ИИ / полупроводникам. Официального подтверждения нет. Пометка: слух / медиа-гипотеза, не норма.

Фон: две линии цены, один август

За месяц китайские флагманы шли плотной очередью: DeepSeek, Alibaba, Zhipu плюс Kimi K3 (16 июля, 2,8 трлн, открытые веса) и MiniMax H3. Деловая пресса внутри КНР читает это как давление на глобальный прайс-лист через плотность open-weight релизов.

США в том же окне идут другой дорогой. OpenAI 30 июля режет Luna на 80%; 6–7 августа Luna становится дефолтом бесплатного аккаунта с безлимитным текстом. Google 13 августа выпускает Gemini 3.7 Flash вдвое дешевле. Китай: флагман в веса + градиент пика. США: consumer-free + защита снизу. Обе линии сходятся в августе 2026 как пересборка того, кто платит за decode-токен.

Геофон: open-weight Kimi K3 уже попадал в американскую security-повестку. Решение Alibaba выложить 2,4 Т в этом окне часть аналитиков читает как закрепление международной видимости до возможного ужесточения контроля. Это гипотеза, не документ; игнорировать окно при разборе тайминга нельзя.

Шесть шагов: как перевести «станет ли дороже» в маршрутизацию

Не тащить заголовочный процент в бюджет. Шесть шагов, которые собирают счёт и маршрут:

  1. Разметить пиковое окно. Нарезать текущие вызовы по Пекину: 9–12, 14–18 и остальной внепик. Снять долю токенов по каждому отрезку.
  2. Разобрать строки биллинга. Отдельно: cache-hit вход, cache-miss вход, output. Headline 1100% бьёт только в первую; output +350% — типичный основной вес.
  3. Сверить официал / ресейл / замену. Пиковый официальный DeepSeek не обязан быть минимумом. Параллельно: Qwen3.8-Max международный ($2 / $6) и GPT-5.6 Luna ($0,20 / $1,20). GMI / Novita могут быть дешевле официального пика.
  4. Читать LICENSE, не тред. Личное и внутреннее использование почти не затронуто. MaaS / AI-помощник с выручкой направления >$50 млн за 12 месяцев — отдельный коммерческий договор. Геозапрет в тексте отсутствует.
  5. GLM-5.3 держать как «открытый эшелон», не как приказ на cutover. Самотест без third-party; Terminal-Bench 3.0 ниже Sol / Fable 5. Малый трафик на сравнение — да; полный переключатель — нет.
  6. Сдвинуть батч и локальный инференс весов на постоянно живую ноду. Крышка ноутбука убивает ночной внепик. Для 7×24-планирования нужны выделенный macOS-узел, очередь батчей, локальные веса и журнал вызовов — не одноразовая cloud-функция.
python
# DeepSeek V4-Pro, грубая оценка: только влияние «пик vs внепик» на output
# Тариф с 2026-08-17 (юань / млн токенов)
PEAK_OUT, OFF_OUT = 27.0, 13.5

def monthly_output_bill(out_tokens_m, peak_share):
    peak = out_tokens_m * peak_share * PEAK_OUT
    off = out_tokens_m * (1 - peak_share) * OFF_OUT
    return round(peak + off, 2)

print(monthly_output_bill(10, 0.8))  # 10 млн, пик 80% → ¥243.0
print(monthly_output_bill(10, 0.2))  # 10 млн, пик 20% → ¥162.0

Три факта, которые можно класть в слайд

  • ~1100%. V4-Pro, cache-hit вход в пике: ¥0,025 → ¥0,30 / млн токенов. Абсолют мал, заголовок максимален.
  • 2,4 Т / 95 млрд. Qwen3.8-2.4T-A95B: 2,4 трлн всего, 95 млрд активных; веса 262 144 токенов, расширение ~1,01 млн; облако — 1 млн.
  • 4,6% → 28,3%. GLM-5.3 на том же базисе 743 млрд, Terminal-Bench 3.0 почти 6×; всё ещё позади Sol 34,6% и Fable 5 33,7%.

Сведение: право цены расслоилось, очередь и веса всё равно нужны на своей ноде

Пять августовских дней сложили три механизма на одну таблицу: DeepSeek записал дефицит GPU в пик/внепик; Alibaba обменяла веса на экосистему и оставила торг в лицензии; Zhipu показала, что масштабированный RL на пост-тренинге двигает агентские бенчмарки без нового базиса. У команд, которые крутят агентов и локальные веса, три структурных узких места остаются теми же:

  • Сон ноутбука режет внепиковое окно. Крышка = отказ от ночного пекинского внепика; заголовочный процент падает на счёт как есть.
  • Общая дев-машина смешивает секреты и очередь. API-ключи, файлы весов и батч на одном засыпающем хосте: пик не посчитать, лицензию не проаудировать.
  • Нет 7×24-узла планирования. Сдвиг батча, локальный инференс open-weight и журнал вызовов требуют выделенной ноды, не временной функции.

Если сдвиг на внепик, инференс открытых весов и аудит API-счёта нужно держать в стабильной, изолируемой топологии, облачные Mac MACCOME дают настоящий macOS, SSH-передачу и контролируемую сетевую границу для 7×24. Публичные тарифы: аренда Mac mini.

Источники: официальный анонс тарифов DeepSeek, сверка Wallstreetcn / IT Home / AIGC-навигаторы / V2EX; репозитории Qwen (Hugging Face / ModelScope) и материалы SCMP по лицензии; техстраница Z.ai по GLM-5.3, VentureBeat, StableLearn; блог Meta AI Research и VentureBeat по Muse Glimmer; сводки Yicai / Sohu Finance по плотности китайских релизов. Срез — на момент публикации; цены, лицензию и бенчмарки перед продом сверять с свежим официальным текстом. Чип-сервис, «уязвимость Cursor» и слух об экспортном контроле в тексте помечены как непроверенные независимо.

Частые вопросы

После повышения тарифов DeepSeek API всегда станет дороже?

Зависит от окна и доли cache hit. Если вызовы в основном вне пика Пекина (не 9–12 и не 14–18) и cache hit высокий, реалистичный рост тяжёлого счёта около 1,8×, а не 350% или 1100%. Если трафик сидит в пике и cache miss доминирует, счёт приближается к заголовочным процентам. Чтобы держать 7×24-сдвиг на внепик, нужна нода без сна крышки: тарифы облачных Mac MACCOME.

Может ли частный разработчик бесплатно коммерчески использовать открытые веса Qwen3.8-Max?

Личная разработка и внутреннее использование почти не затронуты. Если продукт — MaaS или AI-помощник и выручка этого направления за 12 месяцев превысила $50 млн, нужна отдельная коммерческая лицензия Alibaba. При 100 млн MAU или $20 млн выручки в месяц имя модели должно быть явно указано в интерфейсе. Географического запрета на скачивание в тексте лицензии нет.

GLM-5.3 и GLM-5.2 — одна модель? Почему скачок такой резкий?

Базис тот же: 743 млрд параметров, повторного pretrain не было. Скачок дал пост-тренинг: Zhipu расширила RL-среду на том же базисе. Terminal-Bench 3.0: 4,6% → 28,3% — самотест вендора, без независимой перепроверки; модель всё ещё позади Sol 34,6% и Fable 5 33,7%.

Правда ли, что лицензия Qwen3.8-Max запрещает скачивание пользователям из США и ЕС?

Нет. Это ложный слух. В официальном тексте нет территориального запрета. Ограничения завязаны на выручку MaaS и требование показывать имя модели, а не на страну пользователя.

Открытие Muse Glimmer означает возврат Meta к духу эпохи Llama?

Пока это частичный жест. Muse Glimmer — дистиллят на 30 млрд под Apache 2.0. Флагман Muse Spark 1.2 остаётся закрытым: Цукерберг только анонсировал будущие веса. Пока Spark 1.2 не выложен, о возврате флагмана в open-weight говорить рано. Если нужен постоянно живой Mac под локальные веса или ночной внепиковый батч, см. облачные Mac MACCOME.