Аудитория: разработчики на API GPT-5.6 и ChatGPT Work, FinOps-владельцы, команды, выбирающие между Kimi K3, DeepSeek и OpenAI. Событие (30.07.2026): OpenAI снизила Luna на −80% и Terra на −20%, оставила Sol по list price и добавила Fast mode в 2× цены с ускорением до 2.5× — через 3 недели после релиза GPT-5.6. В статье: таймлайн, таблицы трёх tier, механика self-optimized GPU kernels, матрица конкурентов, контроверсии, 6-шаговый runbook маршрутизации Agent. Стартовые спеки: обзор релиза GPT-5.6.
TL;DR — вердикт за 30 секунд
После анонса 30.07 большинство команд упирается не в факт «подешевело», а в невозможность перевести трёхуровневую дифференциацию в исполнимую схему API routing:
Ниже — официальные анонсы, пресса и third-party pricing data для закрытия каждой зоны.
Вывод: не изолированная акция, а трёхшаговый сценарий «релиз → раскрытие cost engineering → снижение цен» за 3 недели. Для OpenAI такой темп редок — pricing pressure перешёл из «friendly rivalry» в «must respond now». Open weight K3: разбор Kimi K3.
| Модель | До (input/output, за 1M tokens) | После (input/output) | Изменение |
|---|---|---|---|
| GPT-5.6 Luna | $1.00 / $6.00 | $0.20 / $1.20 | −80% |
| GPT-5.6 Terra | $2.50 / $15.00 | $2.00 / $12.00 | −20% |
| GPT-5.6 Sol (standard) | $5.00 / $30.00 | $5.00 / $30.00 (без изменений) | 0% |
| GPT-5.6 Sol (новый Fast mode) | нет | $10.00 / $60.00 | 2× standard (до 2.5× speed) |
Примечание: Sol Fast заменяет Priority Processing. Intelligence = standard Sol — меняются только speed и price. Подписки ChatGPT Work и Codex без изменений, но потребление квоты Luna/Terra падает вместе со снижением цен. Данные — официальный блог OpenAI (vendor-reported, cross-check с прессой).
Анализ: максимальное снижение — у самого дешёвого tier. Luna таргетирует high-frequency Agent workloads (tool calls, multi-step tasks) — падение цены напрямую снижает порог для long-running Agent pipelines. Terra — умеренная подстройка mid-tier margin. Sol держит list price и добавляет дорогой Fast: capability premium наверху, monetization axis — скорость, не скидка.
По техническому блогу OpenAI, GPT-5.6 Sol в Codex оптимизировал собственный inference stack: переписал и оттюнил production GPU kernel code (open-source GPU languages Triton и Gluon), перепроектировал draft model для speculative decoding, улучшил KV cache management и GPU scheduling. Заявленные результаты: end-to-end service cost −20%, token generation efficiency +15%+; FpSan (floating-point verifier) валидирует AI-переписанный код.
Технический риск: когда модель переписывает код, на котором сама работает, возможны subtle numeric errors. FpSan существует потому, что «trust the model's patches» недостаточно. Публично — первый известный случай frontier model, автономно переписавшей и задеплоившей изменения в production stack с pricing impact. Engineering detail реален; цифра 20% — vendor-reported.
Luna агрессивно падает — price-sensitive, high-concurrency Agent scenes. Terra слегка подстраивается — «good enough, not expensive». Sol остаётся premium + Fast — speed как отдельный SKU. Playbook: «price war снизу, capability premium сверху» — иной, чем single-track value у Moonshot и DeepSeek.
Kimi K3 доминировал в повестке с 16.07. Enterprise buyers осторожнее с крупными AI spend. Снижение цен, раскрытие cost engineering и Fast mode — в одну неделю: targeted counter-move, а не passive cost pass-through. Контекст DeepSeek: DeepSeek V4 GA — цены и миграция.
| Модель | Вендор | Input ($/M tokens) | Output ($/M tokens) | Примечания |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0.20 | $1.20 | После снижения |
| GPT-5.6 Terra | OpenAI | $2.00 | $12.00 | После снижения |
| GPT-5.6 Sol | OpenAI | $5.00 | $30.00 | Без изменений |
| Kimi K3 | Moonshot AI | $3.00 (cache $0.30) | $15.00 | Open weights, 2.8T MoE |
| DeepSeek V4 Pro | DeepSeek | $0.435 (cache $0.0036) | $0.87 | −75% permanent, май 2026 |
| DeepSeek V4 Flash | DeepSeek | $0.14 | $0.28 | Light tier |
| Claude Sonnet 5 | Anthropic | $3.00 (promo $2.00 до 31.08) | $15.00 (promo $10.00) | Standard price = K3 list |
| Gemini 3.5 Flash-Lite | ~$2.80/M суммарно | Light tier | ||
| MAI-Code-1-Flash | Microsoft | $0.75 | $4.50 | Только GitHub Copilot, без standalone API |
Данные: pricing pages вендоров и third-party trackers (Model Price Watch, BenchLM). Часть цифр — promo или vendor-reported; сверяйте billing на каждой платформе.
Анализ: Luna post-cut $1.40/M суммарно ниже Gemini 3.5 Flash-Lite — вход в top tier price war малых моделей. DeepSeek V4 и Kimi K3 cache-hit pricing всё ещё ниже — move закрывает gap, а не переворачивает лидерство. Artificial Analysis по $/завершённой задаче: Kimi K3 vs GPT-5.6 Sol близко — ~$0.94 vs ~$1.04 за task. Token list price игнорирует verbosity и task-completion quality.
Снижение вписано в broader narrative: DeepSeek (V4 Pro −75% с мая), Moonshot (K3 open weights + aggressive pricing), Microsoft (MAI-Code-1-Flash $0.75/$4.50, Copilot-only) — value как main weapon. Sustained price wars могут дать share, но сжимают margins frontier labs: volume за revenue growth — с ценой.
from openai import OpenAI
client = OpenAI() # OPENAI_API_KEY из env
# Luna: high-frequency Agent / tool calls (post-cut $0.20/$1.20 за 1M tokens)
response = client.chat.completions.create(
model="gpt-5.6-luna",
messages=[{"role": "user", "content": "Summarize this log file and extract errors."}],
max_tokens=2048,
)
# Sol Fast: только latency-sensitive production ($10/$60 за 1M tokens)
fast = client.chat.completions.create(
model="gpt-5.6-sol",
messages=[{"role": "user", "content": "Fix this failing unit test."}],
extra_body={"speed": "fast"}, # сверить param name в актуальной доке OpenAI
)
Переключение Luna / Terra / Sol на ноутбуке рвёт Agent sessions при lid-close sleep. API keys разбросаны по dev machines — unified rotation усложняется. Routing experiments в окне price cut превращаются в production incidents на network jitter. Это ops-проблема, не pricing OpenAI — но от неё зависит, станет ли −80% Luna стабильным Agent output.
Multi-tier routing и 7×24 Agent workflows локально скрывают costs, линейно растущие с call volume. Для production среды под AI Agent automation MACCOME Mac Cloud обычно стабильнее: нативный macOS, SSH handoff, изоляция окружений, OpenClaw / Cursor Agent Gateway на dedicated instances с Luna-default и Sol fallback. Тарифы: аренда Mac mini.
Источники: OpenAI «Advancing the price-performance frontier with GPT-5.6», «How GPT-5.6 fuses frontier intelligence with frontier efficiency» (29–30.07.2026); VentureBeat, The Decoder, CNBC/Reuters/Axios; IT Home, 36Kr, Wall Street CN, CNA; The New Stack, Hardware Busters (METR evals, Reddit); Model Price Watch, BenchLM.ai, Artificial Analysis. Сверяйте актуальные цены и политики перед production cutover.
FAQ
Сколько стоит GPT-5.6 Luna после снижения цен?
После снижения 30.07.2026 Luna API: $0.20 за 1M input tokens и $1.20 за 1M output tokens — падение на 80% от исходных $1.00/$6.00. Максимальное снижение в линейке GPT-5.6.
Почему Sol не подешевел, а появился более дорогой Fast mode?
OpenAI позиционирует Sol как capability-premium флагман. Fast mode — 2× standard ($10.00/$60.00 за 1M tokens), до 2.5× speed. Качество модели не меняется — замена Priority Processing. Стартовые спеки: обзор релиза GPT-5.6.
Можно ли доверять заявлению OpenAI об оптимизации GPU-кода ИИ?
Vendor-reported. Third party не аудировал конкретные 20% cost. Пресса трактует как первый public case frontier model, переписавшей и задеплоившей production stack — Triton/Gluon и FpSan несут engineering credibility, но к проценту экономии относитесь осторожно.
Что это значит для разработчиков вне США?
На official API или third-party gateways — явное снижение cost Luna и Terra, особенно для batch jobs и Agent pipelines. Compliance routing, FX и platform markups влияют на landed price; сверяйте rates вашего канала.
GPT-5.6 всё ещё дороже Kimi K3 и DeepSeek V4 Pro?
По token list price Luna ниже многих международных конкурентов, но выше DeepSeek V4. Sol дороже K3 и V4 Pro. Per-completed-task benchmarks существенно сужают gap. Multi-model routing на dedicated node: тарифы MACCOME Mac Cloud.