Лид. С 12 по 17 августа три китайских вендора сдвинули сразу три рычага: DeepSeek ввёл пик/внепик и поднял API до ~1100% на cache-hit входе V4-Pro; Alibaba выложила веса флагмана Qwen3.8-Max на 2,4 трлн параметров; Zhipu на том же базисе 743 млрд разогнала GLM-5.3 только пост-тренингом RL. Ниже — таймлайн, тарифы cache hit/miss, лицензия, самотесты и маршрутизация счёта. Фон V4 и пикового окна: гайд по миграции DeepSeek V4 GA. Окно релиза Qwen: разбор Qwen3.8-Max.
Рабочий вывод: три схемы — пиковый биллинг, открытые веса с кастомной лицензией, RL без нового pretrain — бьют в одну точку: право назначать цену, а не гонку «кто дешевле на миллион токенов». Цены, лицензия и бенчмарки сверены с публичными анонсами. Чип Zhenwu M890, «уязвимость Cursor» и слух MOFCOM помечены как непроверенные независимо.
Заголовочная цифра громкая. Для команды, которая крутит агентов, оценивает open-weight и режет API-счёт, решение ломается на шести местах, где механизм и процент расходятся:
Отъехать на месяц назад: 30 июля OpenAI срезал самый дешёвый ярус GPT-5.6 Luna на 80%, 6–7 августа сделал Luna дефолтом для бесплатных аккаунтов и открыл безлимитный текст. Китайские вендоры в те же дни добавляют цену и веса; американские — режут цену и раздают квоту. Это две стороны одной игры за throughput и право биллинга, а не «две индустрии». Детали Luna: разбор снижения цен GPT-5.6.
| Дата | Событие |
|---|---|
| 16 июля | Moonshot открывает веса Kimi K3 (2,8 трлн параметров); ранее уже вызывал интерес американских регуляторов |
| 2–3 августа | Alibaba сначала тизерит Qwen3.8-Max, затем поднимает облачный API |
| 10 августа | Meta выпускает Muse Glimmer (30 млрд, Apache 2.0) и обещает веса флагмана Muse Spark 1.2; Spark 1.2 всё ещё закрыт |
| 12 августа | Alibaba выкладывает веса Qwen3.8-2.4T-A95B на ModelScope / Hugging Face; в тот же день xAI выпускает Grok 4.6 |
| 13 августа | DeepSeek-V4-Pro GA и анонс повышения с 17 августа; Google режет Gemini 3.7 Flash вдвое |
| 14 августа | Zhipu выпускает GLM-5.3 на том же базисе 743 млрд, что и GLM-5.2 |
| 17 августа, 00:00 (Пекин) | Новые тарифы DeepSeek вступают в силу |
Единица — юань за миллион токенов. Максимальный процент сидит на cache-hit входе (до ~12× / 1100%+), но абсолют там крошечный. На тяжёлом трафике счёт двигают output (+350%) и cache-miss вход. Cache hit дешёв, потому что KV уже в памяти; miss платит полный проход префилла. Пик удваивает обе строки относительно внепика: scheduler явно продаёт дефицит GPU, а не «бренд».
| Строка биллинга (за млн токенов) | До повышения | Внепик (новый) | Пик (новый) | Рост (пик) |
|---|---|---|---|---|
| V4-Flash, cache hit (вход) | ¥0,02 | ¥0,05 | ¥0,10 | ~400% |
| V4-Flash, cache miss (вход) | ¥1,0 | ¥1,5 | ¥3,0 | 200% |
| V4-Flash, выход | ¥2,0 | ¥4,5 | ¥9,0 | 350% |
| V4-Pro, cache hit (вход) | ¥0,025 | ¥0,15 | ¥0,30 | ~1100% |
| V4-Pro, cache miss (вход) | ¥3,0 | ¥4,5 | ¥9,0 | 200% |
| V4-Pro, выход | ¥6,0 | ¥13,5 | ¥27,0 | 350% |
Источник строк: официальный анонс DeepSeek, сверка с Wallstreetcn, IT Home, V2EX. Заголовочные 1100% — только cache-hit вход V4-Pro в пике. Output +350% — типичный основной вес реального счёта.
Впервые Alibaba открывает Max-класс. Предыдущие Qwen3.5 / 3.6 / 3.7 Max оставались закрытым API. MoE здесь важнее заголовка «2,4 Т»: 512 экспертов, 10 маршрутизируемых + 1 общий — в инференсе живёт не полная матрица, а ~95 млрд активных параметров на токен. Throughput и VRAM считаются от активного слоя, не от каталожных 2,4 Т.
| Параметр | Значение |
|---|---|
| Масштаб | 2,4 трлн всего, 95 млрд активных (MoE, 512 экспертов, 10 routed + 1 shared) |
| Контекст | Веса: 262 144 токенов нативно, расширение ~1,01 млн; облачный Max: 1 млн |
| Ритм релиза | 2 августа тизер → 3 августа API → 12 августа веса |
| API (международный стенд) | вход $2 / млн токенов, выход $6 / млн |
| Лицензия | не Apache 2.0; кастомная «Qwen3.8-Max License» |
| Порог коммерции | MaaS / AI-помощник >$50 млн / 12 мес. — отдельный договор; 100 млн MAU или $20 млн / мес. — явное имя модели в UI |
| Геозапрет | в тексте лицензии отсутствует (слух о бане США/ЕС — ложный) |
Ниже — самотест Zhipu, независимой перепроверки нет. На Terminal-Bench 3.0 GLM-5.3 всё ещё позади GPT-5.6 Sol (34,6%) и Claude Fable 5 (33,7%). Это не «вершина рынка», а скачок внутри открытого эшелона за счёт масштаба RL-среды, без нового pretrain.
| Бенчмарк | GLM-5.2 | GLM-5.3 | Дельта |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6% | 28,3% | +23,7 |
| DeepSWE v1.1 | 46,2% | 66,9% | +20,7 |
| Agents' Last Exam (CLI) | 23,8% | 28,5% | +4,7 |
| CyberGym | 77,2% | 84,5% | +7,3 |
| AutomationBench | 26,2% | 48,2% | +22,0 |
Повышение легко прочитать как «все подняли — и мы». Структура тарифа говорит иначе. Раньше DeepSeek держал одну низкую цену без окна: масштаб пользователей покупался дешевизной, себестоимость размазывалась cache hit и ночным сдвигом. Когда вызовы растут быстрее поставки GPU, плоская цена перестаёт сходиться. Фраза анонса про «более гибкое планирование нагрузки» читается прямо: пик забит, сдвиньте батч сами.
Механика строк. Cache hit (¥0,30 в пике на Pro) дёшев, потому что префилл уже в KV; headline 1100% бьёт сюда, потому что база была ¥0,025. Cache miss (¥9 в пике) — полный префилл. Output (¥27 в пике) — decode, самый дорогой по GPU-времени токен. Тяжёлый агент с длинным ответом платит output, не headline. Реалистичный рост такого счёта около 1,8×, если часть трафика уезжает во внепик и cache hit остаётся высоким.
В пике официальный API уже может проигрывать ресейлу: котировки GMI Cloud и Novita на сверке ниже официального пика. Гипотеза «официал = минимум» сломалась в первый раз.
Открытие 2,4 Т — не «благотворительность». Alibaba делает две вещи сразу: веса Qwen3.8-2.4T-A95B можно скачать; лицензия не Apache 2.0. MaaS или AI-помощник с выручкой направления >$50 млн за 12 месяцев идёт на отдельный коммерческий договор. Продукт с 100 млн MAU или $20 млн выручки в месяц обязан явно показать имя модели. Экосистема и репутация (в том числе у зарубежных разработчиков) покупаются весами; право торговаться на крупном кэше остаётся у вендора.
По степени открытости это другой класс, чем Muse Glimmer (Apache 2.0, 30 млрд, без доп. порогов). Порог Kimi K3 для сравнения: разбор полного open-weight Kimi K3.
Отдельный слух: лицензия якобы запрещает скачивание из США, ЕС, Великобритании и Кореи. В официальном тексте территориального запрета нет. Ограничения завязаны на выручку и UI-атрибуцию, не на гео. Слух бежит быстрее, чем чтение LICENSE.
Интересен не сам балл, а способ его получить. Базис GLM-5.3 = GLM-5.2 = 743 млрд, повторного pretrain нет. Zhipu расширила RL-среду на пост-тренинге и подняла Terminal-Bench 3.0 с 4,6% до 28,3% — почти 6× на одном базисе. Когда предельная отдача pretrain-scaling падает, масштабирование RL на пост-тренинге становится отдельным рычагом: порог входа ниже, чем новый базис на сотни миллиардов. Отсюда и оговорка: это самотест, Sol 34,6% и Fable 5 33,7% всё ещё выше, полный cutover по одной таблице — ошибка маршрутизации.
Курс для перевода — ¥7,15 / $1, ориентир, не фикс казначейства. Внепик V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не минимум поля: международный Qwen3.8-Max ($2 / $6) и GPT-5.6 Luna ($0,20 / $1,20) дешевле внепика DeepSeek. Уравнение «китайская модель = самая дешёвая» расслоилось: пик, внепик, hosted open-weight и consumer-free — разные полки.
| Модель | Вход (за млн токенов) | Выход (за млн токенов) | Открытость весов |
|---|---|---|---|
| DeepSeek V4-Pro (пик) | ¥9,0 (~$1,26) | ¥27,0 (~$3,78) | веса закрыты |
| DeepSeek V4-Pro (внепик) | ¥4,5 (~$0,63) | ¥13,5 (~$1,89) | веса закрыты |
| Qwen3.8-Max (международный стенд) | $2 | $6 | открыты (кастомная лицензия) |
| OpenAI GPT-5.6 Luna | $0,20 | $1,20 | закрыты |
| Claude Opus 5 (оценка по кратности, раскрытой Alibaba) | ~$5 | ~$25 | закрыты |
За месяц китайские флагманы шли плотной очередью: DeepSeek, Alibaba, Zhipu плюс Kimi K3 (16 июля, 2,8 трлн, открытые веса) и MiniMax H3. Деловая пресса внутри КНР читает это как давление на глобальный прайс-лист через плотность open-weight релизов.
США в том же окне идут другой дорогой. OpenAI 30 июля режет Luna на 80%; 6–7 августа Luna становится дефолтом бесплатного аккаунта с безлимитным текстом. Google 13 августа выпускает Gemini 3.7 Flash вдвое дешевле. Китай: флагман в веса + градиент пика. США: consumer-free + защита снизу. Обе линии сходятся в августе 2026 как пересборка того, кто платит за decode-токен.
Геофон: open-weight Kimi K3 уже попадал в американскую security-повестку. Решение Alibaba выложить 2,4 Т в этом окне часть аналитиков читает как закрепление международной видимости до возможного ужесточения контроля. Это гипотеза, не документ; игнорировать окно при разборе тайминга нельзя.
Не тащить заголовочный процент в бюджет. Шесть шагов, которые собирают счёт и маршрут:
# DeepSeek V4-Pro, грубая оценка: только влияние «пик vs внепик» на output
# Тариф с 2026-08-17 (юань / млн токенов)
PEAK_OUT, OFF_OUT = 27.0, 13.5
def monthly_output_bill(out_tokens_m, peak_share):
peak = out_tokens_m * peak_share * PEAK_OUT
off = out_tokens_m * (1 - peak_share) * OFF_OUT
return round(peak + off, 2)
print(monthly_output_bill(10, 0.8)) # 10 млн, пик 80% → ¥243.0
print(monthly_output_bill(10, 0.2)) # 10 млн, пик 20% → ¥162.0
Пять августовских дней сложили три механизма на одну таблицу: DeepSeek записал дефицит GPU в пик/внепик; Alibaba обменяла веса на экосистему и оставила торг в лицензии; Zhipu показала, что масштабированный RL на пост-тренинге двигает агентские бенчмарки без нового базиса. У команд, которые крутят агентов и локальные веса, три структурных узких места остаются теми же:
Если сдвиг на внепик, инференс открытых весов и аудит API-счёта нужно держать в стабильной, изолируемой топологии, облачные Mac MACCOME дают настоящий macOS, SSH-передачу и контролируемую сетевую границу для 7×24. Публичные тарифы: аренда Mac mini.
Источники: официальный анонс тарифов DeepSeek, сверка Wallstreetcn / IT Home / AIGC-навигаторы / V2EX; репозитории Qwen (Hugging Face / ModelScope) и материалы SCMP по лицензии; техстраница Z.ai по GLM-5.3, VentureBeat, StableLearn; блог Meta AI Research и VentureBeat по Muse Glimmer; сводки Yicai / Sohu Finance по плотности китайских релизов. Срез — на момент публикации; цены, лицензию и бенчмарки перед продом сверять с свежим официальным текстом. Чип-сервис, «уязвимость Cursor» и слух об экспортном контроле в тексте помечены как непроверенные независимо.
Частые вопросы
После повышения тарифов DeepSeek API всегда станет дороже?
Зависит от окна и доли cache hit. Если вызовы в основном вне пика Пекина (не 9–12 и не 14–18) и cache hit высокий, реалистичный рост тяжёлого счёта около 1,8×, а не 350% или 1100%. Если трафик сидит в пике и cache miss доминирует, счёт приближается к заголовочным процентам. Чтобы держать 7×24-сдвиг на внепик, нужна нода без сна крышки: тарифы облачных Mac MACCOME.
Может ли частный разработчик бесплатно коммерчески использовать открытые веса Qwen3.8-Max?
Личная разработка и внутреннее использование почти не затронуты. Если продукт — MaaS или AI-помощник и выручка этого направления за 12 месяцев превысила $50 млн, нужна отдельная коммерческая лицензия Alibaba. При 100 млн MAU или $20 млн выручки в месяц имя модели должно быть явно указано в интерфейсе. Географического запрета на скачивание в тексте лицензии нет.
GLM-5.3 и GLM-5.2 — одна модель? Почему скачок такой резкий?
Базис тот же: 743 млрд параметров, повторного pretrain не было. Скачок дал пост-тренинг: Zhipu расширила RL-среду на том же базисе. Terminal-Bench 3.0: 4,6% → 28,3% — самотест вендора, без независимой перепроверки; модель всё ещё позади Sol 34,6% и Fable 5 33,7%.
Правда ли, что лицензия Qwen3.8-Max запрещает скачивание пользователям из США и ЕС?
Нет. Это ложный слух. В официальном тексте нет территориального запрета. Ограничения завязаны на выручку MaaS и требование показывать имя модели, а не на страну пользователя.
Открытие Muse Glimmer означает возврат Meta к духу эпохи Llama?
Пока это частичный жест. Muse Glimmer — дистиллят на 30 млрд под Apache 2.0. Флагман Muse Spark 1.2 остаётся закрытым: Цукерберг только анонсировал будущие веса. Пока Spark 1.2 не выложен, о возврате флагмана в open-weight говорить рано. Если нужен постоянно живой Mac под локальные веса или ночной внепиковый батч, см. облачные Mac MACCOME.