Kurzfassung: Zwischen dem 12. und 17. August 2026 haben drei chinesische Labore drei scheinbar gegensätzliche Züge gemacht: DeepSeek hebt die API-Preise um bis zu rund 1.100 % an, Alibaba legt erstmals Max-Gewichte mit 2,4 Bio. Parametern offen, Zhipu zieht GLM-5.3 auf derselben 743-Mrd.-Basis nur per Post-Training nach oben. Dieser Text ordnet Zeitlinie, Preistabelle, Lizenz und Selbsttests — ohne die Schlagzeile mit der Rechnung zu verwechseln. Hintergrund zur V4-Vollversion und zur bisherigen Spitzen-/Nebenzeit-Logik: DeepSeek V4 GA, Preise und Migration. Zum Qwen-Release-Fenster: Qwen3.8-Max Arena und Open-Source-Label.
Ein Satz: Drei Firmen, drei Hebel — derselbe Signalwechsel von „billigste Token“ zu „wer die Preissetzung hält“. Preise, Lizenz und Benchmarks sind gegen öffentliche Ankündigungen geprüft. Zhenwu M890, die behauptete Cursor-Lücke und das MOFCOM-Gerücht sind gesondert als nicht unabhängig verifiziert markiert.
Die Prozentzahl trägt Klicks. Für Agent-Routinen, Open-Weight-Bewertung und API-Budgets entscheiden andere Parameter — und die Verfügbarkeit der Spitzenfenster:
Den Blick weiten: Am 30. Juli senkte OpenAI GPT-5.6 Luna um 80 %; am 6. und 7. August wurde Luna für kostenlose Konten zum Standard mit unbegrenztem Textchat. Während chinesische Anbieter Preise staffeln und Gewichte öffnen, verteidigen US-Anbieter über Senkung und Gratiszugang. Das ist dieselbe Preispartie von zwei Seiten. Luna-Details: GPT-5.6-Preissenkung Luna, Terra, Sol.
| Datum | Ereignis |
|---|---|
| 16. Juli | Moonshot öffnet Kimi K3 (2,8 Bio. Parameter); die Freigabe hatte zuvor US-Sicherheitsdebatten ausgelöst |
| 2.–3. August | Alibaba kündigt Qwen3.8-Max an und schaltet die Cloud-API frei |
| 10. August | Meta veröffentlicht Muse Glimmer (30 Mrd. Parameter, Apache 2.0) und kündigt Gewichte für das Flaggschiff Muse Spark 1.2 an — Spark 1.2 bleibt geschlossen |
| 12. August | Alibaba legt Qwen3.8-2.4T-A95B-Gewichte auf ModelScope / Hugging Face; am selben Tag erscheint xAI Grok 4.6 |
| 13. August | DeepSeek-V4-Pro-Vollversion plus Ankündigung der API-Erhöhung ab 17. August; Google senkt Gemini 3.7 Flash um die Hälfte |
| 14. August | Zhipu veröffentlicht GLM-5.3 auf derselben 743-Mrd.-Basis wie GLM-5.2 |
| 17. August, 00:00 Uhr Peking | Neue DeepSeek-Preise gelten |
Einheit: je 1 Mio. Token. Der Cache-Hit-Eingang trägt den größten relativen Sprung (bis rund das 12-Fache / über 1.100 %), bleibt aber absolut klein. Für Intensivnutzer wiegen Ausgabe (350 %) und Cache-Miss-Eingabe schwerer.
| Position (je 1 Mio. Token) | Vorher | Nebenzeit (neu) | Spitze (neu) | Anstieg (Spitze) |
|---|---|---|---|---|
| V4-Flash Cache-Hit Eingabe | ¥0,02 | ¥0,05 | ¥0,10 | ca. 400 % |
| V4-Flash Cache-Miss Eingabe | ¥1,0 | ¥1,5 | ¥3,0 | 200 % |
| V4-Flash Ausgabe | ¥2,0 | ¥4,5 | ¥9,0 | 350 % |
| V4-Pro Cache-Hit Eingabe | ¥0,025 | ¥0,15 | ¥0,30 | ca. 1.100 % |
| V4-Pro Cache-Miss Eingabe | ¥3,0 | ¥4,5 | ¥9,0 | 200 % |
| V4-Pro Ausgabe | ¥6,0 | ¥13,5 | ¥27,0 | 350 % |
Quelle: DeepSeek-Offizielle, gegen Wall Street CN, IT Home und V2EX gegencheckt. Die Schlagzeile „1.100 %“ trifft nur den Cache-Hit-Eingang in der Spitze. Ausgabe plus 350 % ist für die meisten echten Rechnungen der Hauptposten.
Erstmals legt Alibaba ein Max-Flaggschiff offen. Qwen3.5 / 3.6 / 3.7 Max blieben geschlossene APIs.
| Parameter | Wert |
|---|---|
| Parameterumfang | 2,4 Bio. gesamt, 95 Mrd. aktiv (MoE, 512 Experten, 10 geroutet + 1 geteilt) |
| Kontextfenster | Open Weights nativ 262.144 Token, erweiterbar auf ca. 1,01 Mio.; gehostete Max-Variante 1 Mio. Token |
| Release-Takt | 2. August Ankündigung → 3. August API → 12. August Open Weights |
| API-Preis (International) | Eingabe 2 USD / 1 Mio. Token, Ausgabe 6 USD / 1 Mio. Token |
| Lizenz | nicht Apache 2.0, sondern eigene Qwen3.8-Max License |
| Bedeutung | erstes Max-Flaggschiff von Alibaba mit offenen Gewichten |
Die Werte sind Zhipu-Selbsttests; eine unabhängige Drittreproduktion fehlt. Auf Terminal-Bench 3.0 liegt GLM-5.3 weiter hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %). Das ist erste Open-Weight-Liga, kein Gesamtsieg.
| Benchmark | GLM-5.2 | GLM-5.3 | Änderung |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 % | 28,3 % | +23,7 |
| DeepSWE v1.1 | 46,2 % | 66,9 % | +20,7 |
| Agents' Last Exam (CLI) | 23,8 % | 28,5 % | +4,7 |
| CyberGym | 77,2 % | 84,5 % | +7,3 |
| AutomationBench | 26,2 % | 48,2 % | +22,0 |
Die Erhöhung als bloßes „Mitziehen“ zu lesen, verfehlt die Struktur. DeepSeek hat lange einen einheitlichen Niedrigpreis ohne Tageszeiten gefahren: Volumen gegen Cache-Hits und Lastverschiebung. Steigt die Nachfrage schneller als die GPU-Verfügbarkeit, trägt dieses Modell nicht mehr. Der Satz in der Ankündigung, flexiblere Lastplanung zu fördern, heißt praktisch: Die Kapazität reicht in der Spitze nicht, bitte selbst verschieben.
Ein operatives Detail: In der Spitze kann der offizielle DeepSeek-Preis über aktuellen Angeboten von GMI Cloud und Novita liegen. Die Annahme „offiziell ist immer am günstigsten“ — lange Teil der DeepSeek-Rechnung — gilt in diesem Fenster nicht mehr. Für die Systemstabilität folgt daraus: Wer die Nebenzeit nutzen will, braucht einen Knoten, der nachts nicht einschläft; sonst fällt die Last zurück in die teure Spitze.
Die 2,4-Bio.-Freigabe ist kein reiner Freigabeakt. Alibaba macht zwei Dinge zugleich: Die Gewichte sind herunterladbar, die Lizenz ist nicht Apache 2.0. Model-as-a-Service oder KI-Arbeitsassistenten mit mehr als 50 Mio. USD Umsatz in den letzten 12 Monaten brauchen eine gesonderte Kommerzlizenz. Produkte mit über 100 Mio. MAU oder über 20 Mio. USD Monatsumsatz müssen den Modellnamen sichtbar führen.
Die Kombination zielt auf Entwicklerreichweite — auch außerhalb Chinas — und hält bei zahlungskräftigen Diensten die Verhandlungsmacht. Gegen Metas Muse Glimmer (Apache 2.0, ohne Zusatzklauseln) ist das ein anderes Open-Weight-Niveau. Schwellen im Vergleich: Kimi K3 Vollfreigabe.
Ein verbreitetes Gerücht behauptet, die Lizenz verbiete Downloads in den USA, der EU, dem Vereinigten Königreich oder Südkorea. Das Geo-Verbot ist falsch: Der offizielle Text enthält keine geografische Sperre. Die Klauseln hängen am Umsatz, nicht am Standort.
Datenschutz: Cloud-API und Self-Hosting der Open Weights sind für die DSGVO nicht dasselbe. Personenbezogene EU-Daten über eine API nach China zu schicken, ist ein Drittlandtransfer mit AVV, Zweckbindung und Löschkonzept. Liegen die Gewichte auf einem von Ihnen kontrollierten Knoten in der EU oder einem angemessenen Drittland, bleibt die Inferenz im eigenen Weisungsbereich — die Parameterzahl ändert daran nichts, der Verarbeitungsweg schon.
Entscheidend ist nicht nur die Punktzahl, sondern der Weg: dieselbe 743-Mrd.-Basis wie GLM-5.2, kein neues Vortraining. Allein durch ein größeres Verstärkungslern-Umfeld im Post-Training steigt Terminal-Bench 3.0 von 4,6 % auf 28,3 % — knapp das Sechsfache. Das stützt den Trend der letzten Monate: Wenn Vortraining an den Rändern flacher wird, wird skaliertes Post-Training der günstigere Hebel — und die Schwelle liegt unter einem neuen hundertmilliardenschweren Vortraining. Die Werte bleiben Selbsttests; hinter Sol 34,6 % und Fable 5 33,7 % ist das kein Grund, die Produktion in einem Schritt umzuschalten.
Umrechnung grob ¥7,15 je 1 USD, nur zur Orientierung; maßgeblich bleibt die offizielle Liste. V4-Pro in der Nebenzeit liegt weiter klar unter Claude Opus 5, ist aber nicht mehr das Feldminimum: Qwen3.8-Max International (2 / 6 USD) und GPT-5.6 Luna (0,20 / 1,20 USD) unterbieten die DeepSeek-Nebenzeit. „Chinesisch = am günstigsten“ löst sich in Schichten auf.
| Modell | Eingabe (je 1 Mio. Token) | Ausgabe (je 1 Mio. Token) | Open-Weight-Status |
|---|---|---|---|
| DeepSeek V4-Pro (Spitze) | ¥9,0 (ca. 1,26 USD) | ¥27,0 (ca. 3,78 USD) | Gewichte geschlossen |
| DeepSeek V4-Pro (Nebenzeit) | ¥4,5 (ca. 0,63 USD) | ¥13,5 (ca. 1,89 USD) | Gewichte geschlossen |
| Qwen3.8-Max (International) | 2 USD | 6 USD | offen (eigene Lizenz) |
| OpenAI GPT-5.6 Luna | 0,20 USD | 1,20 USD | geschlossen |
| Claude Opus 5 (aus von Alibaba genannten Vielfachen abgeleitet) | ca. 5 USD | ca. 25 USD | geschlossen |
Im größeren Bild verdichten chinesische Frontier-Labs den Takt: neben DeepSeek, Alibaba und Zhipu steht Kimi K3 (16. Juli, 2,8 Bio. Parameter offen). Inländische Wirtschaftsmedien lesen das als Open-Weight-Druck, der globale Listen neu setzt.
US-Anbieter gehen den anderen Weg: OpenAI senkt Luna am 30. Juli um 80 % und macht das Modell am 6. und 7. August zum Gratis-Standard; Google halbiert Gemini 3.7 Flash am 13. August. China staffelt und öffnet Flaggschiffe, die USA senken und verschenken Zugang — im August 2026 treffen beide Pfade aufeinander.
Eine geopolitische Lesart: Die Kimi-K3-Freigabe hatte bereits US-Sicherheitsdebatten ausgelöst. Dass Alibaba in diesem Fenster 2,4 Bio. Parameter öffnet, deuten manche als Vorziehen internationaler Reichweite vor einer möglichen Regulierungsenge. Das bleibt eine Interpretation, gehört aber zur Zeitwahl dieser Welle.
Lassen Sie sich nicht von der Schlagzeilenprozentzahl führen. Diese sechs Schritte machen „wird es teurer?“ zu einer Routing-Entscheidung:
# DeepSeek V4-Pro, grobe Rechnung: nur Ausgabe, Spitze gegen Nebenzeit
# Preise ab 17.08.2026 (CNY je 1 Mio. Token)
PEAK_OUT, OFF_OUT = 27.0, 13.5
def monthly_output_bill(out_tokens_m, peak_share):
peak = out_tokens_m * peak_share * PEAK_OUT
off = out_tokens_m * (1 - peak_share) * OFF_OUT
return round(peak + off, 2)
print(monthly_output_bill(10, 0.8)) # 80 % Spitze → ¥243.0
print(monthly_output_bill(10, 0.2)) # 20 % Spitze → ¥162.0
Diese fünf Augusttage legen drei Züge auf dieselbe Liste: DeepSeek schreibt knappe Kapazität in Spitzen- und Nebenzeit, Alibaba tauscht Gewichte gegen Ökosystem und behält über die eigene Lizenz die Verhandlung, Zhipu zeigt, dass Post-Training in die erste Liga reichen kann. Für Teams mit Agenten und offenen Gewichten bleiben drei strukturelle Engpässe:
Wenn Sie Lastverschiebung, Open-Weight-Inferenz und API-Audit in eine stabile, isolierbare Topologie legen wollen, stellen MACCOME Mac-Cloud-Hosts echtes macOS, SSH-Übergabe und eine kontrollierbare Netzgrenze bereit — ausgelegt auf 7×24. Öffentliche Tarife: Mac-mini-Mietpreise.
Quellen: DeepSeek-Preisanzeige, gegencheckt über Wall Street CN, IT Home, AIGC-Navigator und V2EX; Alibaba-Qwen-Modellarchive (Hugging Face / ModelScope) sowie SCMP zur Lizenz; Zhipu (Z.ai) GLM-5.3-Technikseite sowie VentureBeat und StableLearn; Meta-AI-Research-Blog und VentureBeat zu Muse Glimmer; Sammelberichte chinesischer Wirtschaftsmedien zum Veröffentlichungstakt. Stand Redaktionsschluss; Preise, Lizenz und Benchmarks vor einem Produktionswechsel erneut gegen die aktuelle Offizielle prüfen. Zhenwu M890, Cursor-Lücke und MOFCOM-Gerücht sind im Text als nicht unabhängig verifiziert markiert.
Häufige Fragen
Wird DeepSeek nach der Preiserhöhung dauerhaft teurer?
Es kommt auf das Szenario an. Liegen die Aufrufe überwiegend in der Nebenzeit (außerhalb 9–12 und 14–18 Uhr Peking) und ist die Cache-Hit-Rate hoch, bleibt der reale Anstieg deutlich unter den Schlagzeilen von 350 % und 1.100 % — für Intensivnutzer nennen Analysen etwa das 1,8-Fache. Konzentrieren sich die Aufrufe auf die Spitzenfenster bei niedriger Cache-Hit-Rate, nähert sich der Anstieg den Schlagzeilenzahlen. Für 7×24-Nebenzeit-Batches brauchen Sie einen Knoten, der nicht einschläft: MACCOME Mac-mini-Mietpreise.
Dürfen Einzelentwickler Qwen3.8-Max kostenlos kommerziell nutzen?
Einzelentwickler und interner Gebrauch sind weitgehend unberührt. Ist das Geschäft Model-as-a-Service oder ein KI-Arbeitsassistent und hat dieses Geschäft in den letzten 12 Monaten mehr als 50 Mio. USD Umsatz, brauchen Sie eine gesonderte kommerzielle Lizenz von Alibaba. Bei über 100 Mio. MAU oder über 20 Mio. USD Monatsumsatz muss der Modellname in der Oberfläche sichtbar stehen.
Sind GLM-5.3 und GLM-5.2 dasselbe Modell — warum der Sprung?
Die Basis ist identisch (743 Mrd. Parameter); Zhipu hat nicht neu vortrainiert. Der Sprung kommt aus dem Post-Training: die Verstärkungslern-Umgebung wurde deutlich skaliert. Die Zahlen sind Hersteller-Selbsttests ohne unabhängige Drittreproduktion. GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %).
Verbietet die Qwen3.8-Max-Lizenz Downloads in den USA oder der EU?
Nein. Das Geo-Verbot ist falsch. Der offizielle Lizenztext enthält keine geografische Sperre. Die Einschränkungen betreffen kommerzielle Dienste oberhalb bestimmter Umsatzschwellen, unabhängig vom Standort.
Bedeutet Muse Glimmer die Rückkehr des Llama-Open-Source-Geists?
Nur teilweise. Muse Glimmer ist ein destilliertes 30-Mrd.-Modell unter Apache 2.0. Das geschlossene Flaggschiff Muse Spark 1.2 ist noch nicht offen; angekündigt sind lediglich künftige Gewichte. Für Open-Weight-Inferenz auf einem dauerhaften Mac: MACCOME Mac-mini-Mietpreise.