Warum hat DeepSeek die API-Preise um bis zu 1.100 % erhöht — direkt nach Chinas Open-Weight-Offensive?

ca. 20 Min. Lesezeit · MACCOME · Zuletzt aktualisiert: 17. August 2026

Kurzfassung: Zwischen dem 12. und 17. August 2026 haben drei chinesische Labore drei scheinbar gegensätzliche Züge gemacht: DeepSeek hebt die API-Preise um bis zu rund 1.100 % an, Alibaba legt erstmals Max-Gewichte mit 2,4 Bio. Parametern offen, Zhipu zieht GLM-5.3 auf derselben 743-Mrd.-Basis nur per Post-Training nach oben. Dieser Text ordnet Zeitlinie, Preistabelle, Lizenz und Selbsttests — ohne die Schlagzeile mit der Rechnung zu verwechseln. Hintergrund zur V4-Vollversion und zur bisherigen Spitzen-/Nebenzeit-Logik: DeepSeek V4 GA, Preise und Migration. Zum Qwen-Release-Fenster: Qwen3.8-Max Arena und Open-Source-Label.

warning

Ein Satz: Drei Firmen, drei Hebel — derselbe Signalwechsel von „billigste Token“ zu „wer die Preissetzung hält“. Preise, Lizenz und Benchmarks sind gegen öffentliche Ankündigungen geprüft. Zhenwu M890, die behauptete Cursor-Lücke und das MOFCOM-Gerücht sind gesondert als nicht unabhängig verifiziert markiert.

Sechs Punkte: Was Teams nach der Schlagzeile „plus 1.100 %“ wirklich rechnen müssen

Die Prozentzahl trägt Klicks. Für Agent-Routinen, Open-Weight-Bewertung und API-Budgets entscheiden andere Parameter — und die Verfügbarkeit der Spitzenfenster:

  1. Wenn „11-fach“, „plus 1.100 %“ und „plus 350 %“ in einer Zeile stehen, dann sind das drei verschiedene Positionen: Cache-Hit-Eingabe, Ausgabe und Cache-Miss-Eingabe. Wer sie mischt, verdreht das Monatsbudget.
  2. Wenn das Spitzenfenster fehlt, dann fehlt die Hälfte der Rechnung: 9–12 und 14–18 Uhr Peking. Dieselbe Last in der Nebenzeit kann die Ausgabe halbieren.
  3. Wenn „offiziell immer am günstigsten“ gilt, dann stimmt das in der Spitze nicht mehr: GMI Cloud und Novita können den offiziellen Peak unterbieten.
  4. Wenn Open Weight automatisch Apache 2.0 heißen soll, dann liegt Qwen3.8-Max daneben: eigene Lizenz, ab 50 Mio. USD MaaS-Umsatz in 12 Monaten gesonderte Kommerzlizenz.
  5. Wenn ein Geo-Verbot für USA/EU kursiert, dann ist das falsch — der Lizenztext enthält keine geografische Sperre; wer das Gerücht übernimmt, bewertet Compliance falsch.
  6. Wenn GLM-5.3-Selbsttests als Produktions-Switch dienen, dann fehlt die Drittreproduktion; Terminal-Bench 3.0 bleibt hinter Sol 34,6 % und Fable 5 33,7 %.

Was passiert ist: Zeitlinie der zwei Wochen

Den Blick weiten: Am 30. Juli senkte OpenAI GPT-5.6 Luna um 80 %; am 6. und 7. August wurde Luna für kostenlose Konten zum Standard mit unbegrenztem Textchat. Während chinesische Anbieter Preise staffeln und Gewichte öffnen, verteidigen US-Anbieter über Senkung und Gratiszugang. Das ist dieselbe Preispartie von zwei Seiten. Luna-Details: GPT-5.6-Preissenkung Luna, Terra, Sol.

DatumEreignis
16. JuliMoonshot öffnet Kimi K3 (2,8 Bio. Parameter); die Freigabe hatte zuvor US-Sicherheitsdebatten ausgelöst
2.–3. AugustAlibaba kündigt Qwen3.8-Max an und schaltet die Cloud-API frei
10. AugustMeta veröffentlicht Muse Glimmer (30 Mrd. Parameter, Apache 2.0) und kündigt Gewichte für das Flaggschiff Muse Spark 1.2 an — Spark 1.2 bleibt geschlossen
12. AugustAlibaba legt Qwen3.8-2.4T-A95B-Gewichte auf ModelScope / Hugging Face; am selben Tag erscheint xAI Grok 4.6
13. AugustDeepSeek-V4-Pro-Vollversion plus Ankündigung der API-Erhöhung ab 17. August; Google senkt Gemini 3.7 Flash um die Hälfte
14. AugustZhipu veröffentlicht GLM-5.3 auf derselben 743-Mrd.-Basis wie GLM-5.2
17. August, 00:00 Uhr PekingNeue DeepSeek-Preise gelten

Kerndaten: DeepSeek-Preise, Qwen-Spezifikation, GLM-Benchmarks

DeepSeek-Preiserhöhung (ab 17.08.2026, 00:00 Uhr Peking; Spitze 9–12 und 14–18 Uhr Peking)

Einheit: je 1 Mio. Token. Der Cache-Hit-Eingang trägt den größten relativen Sprung (bis rund das 12-Fache / über 1.100 %), bleibt aber absolut klein. Für Intensivnutzer wiegen Ausgabe (350 %) und Cache-Miss-Eingabe schwerer.

Position (je 1 Mio. Token)VorherNebenzeit (neu)Spitze (neu)Anstieg (Spitze)
V4-Flash Cache-Hit Eingabe¥0,02¥0,05¥0,10ca. 400 %
V4-Flash Cache-Miss Eingabe¥1,0¥1,5¥3,0200 %
V4-Flash Ausgabe¥2,0¥4,5¥9,0350 %
V4-Pro Cache-Hit Eingabe¥0,025¥0,15¥0,30ca. 1.100 %
V4-Pro Cache-Miss Eingabe¥3,0¥4,5¥9,0200 %
V4-Pro Ausgabe¥6,0¥13,5¥27,0350 %
info

Quelle: DeepSeek-Offizielle, gegen Wall Street CN, IT Home und V2EX gegencheckt. Die Schlagzeile „1.100 %“ trifft nur den Cache-Hit-Eingang in der Spitze. Ausgabe plus 350 % ist für die meisten echten Rechnungen der Hauptposten.

Qwen3.8-2.4T-A95B (Open Weights von Qwen3.8-Max): Parameter

Erstmals legt Alibaba ein Max-Flaggschiff offen. Qwen3.5 / 3.6 / 3.7 Max blieben geschlossene APIs.

ParameterWert
Parameterumfang2,4 Bio. gesamt, 95 Mrd. aktiv (MoE, 512 Experten, 10 geroutet + 1 geteilt)
KontextfensterOpen Weights nativ 262.144 Token, erweiterbar auf ca. 1,01 Mio.; gehostete Max-Variante 1 Mio. Token
Release-Takt2. August Ankündigung → 3. August API → 12. August Open Weights
API-Preis (International)Eingabe 2 USD / 1 Mio. Token, Ausgabe 6 USD / 1 Mio. Token
Lizenznicht Apache 2.0, sondern eigene Qwen3.8-Max License
Bedeutungerstes Max-Flaggschiff von Alibaba mit offenen Gewichten

GLM-5.3 gegen GLM-5.2: dieselbe Basis, nur Post-Training

Die Werte sind Zhipu-Selbsttests; eine unabhängige Drittreproduktion fehlt. Auf Terminal-Bench 3.0 liegt GLM-5.3 weiter hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %). Das ist erste Open-Weight-Liga, kein Gesamtsieg.

BenchmarkGLM-5.2GLM-5.3Änderung
Terminal-Bench 3.04,6 %28,3 %+23,7
DeepSWE v1.146,2 %66,9 %+20,7
Agents' Last Exam (CLI)23,8 %28,5 %+4,7
CyberGym77,2 %84,5 %+7,3
AutomationBench26,2 %48,2 %+22,0

Drei Strategien, drei Logiken

1. DeepSeek: von der Flachpreis-Liste zur Zeitstaffel — knappe Rechenkapazität wird sichtbar

Die Erhöhung als bloßes „Mitziehen“ zu lesen, verfehlt die Struktur. DeepSeek hat lange einen einheitlichen Niedrigpreis ohne Tageszeiten gefahren: Volumen gegen Cache-Hits und Lastverschiebung. Steigt die Nachfrage schneller als die GPU-Verfügbarkeit, trägt dieses Modell nicht mehr. Der Satz in der Ankündigung, flexiblere Lastplanung zu fördern, heißt praktisch: Die Kapazität reicht in der Spitze nicht, bitte selbst verschieben.

Ein operatives Detail: In der Spitze kann der offizielle DeepSeek-Preis über aktuellen Angeboten von GMI Cloud und Novita liegen. Die Annahme „offiziell ist immer am günstigsten“ — lange Teil der DeepSeek-Rechnung — gilt in diesem Fenster nicht mehr. Für die Systemstabilität folgt daraus: Wer die Nebenzeit nutzen will, braucht einen Knoten, der nachts nicht einschläft; sonst fällt die Last zurück in die teure Spitze.

2. Alibaba: Gewichte für das Ökosystem, eigene Lizenz für den Umsatz

Die 2,4-Bio.-Freigabe ist kein reiner Freigabeakt. Alibaba macht zwei Dinge zugleich: Die Gewichte sind herunterladbar, die Lizenz ist nicht Apache 2.0. Model-as-a-Service oder KI-Arbeitsassistenten mit mehr als 50 Mio. USD Umsatz in den letzten 12 Monaten brauchen eine gesonderte Kommerzlizenz. Produkte mit über 100 Mio. MAU oder über 20 Mio. USD Monatsumsatz müssen den Modellnamen sichtbar führen.

Die Kombination zielt auf Entwicklerreichweite — auch außerhalb Chinas — und hält bei zahlungskräftigen Diensten die Verhandlungsmacht. Gegen Metas Muse Glimmer (Apache 2.0, ohne Zusatzklauseln) ist das ein anderes Open-Weight-Niveau. Schwellen im Vergleich: Kimi K3 Vollfreigabe.

Ein verbreitetes Gerücht behauptet, die Lizenz verbiete Downloads in den USA, der EU, dem Vereinigten Königreich oder Südkorea. Das Geo-Verbot ist falsch: Der offizielle Text enthält keine geografische Sperre. Die Klauseln hängen am Umsatz, nicht am Standort.

Datenschutz: Cloud-API und Self-Hosting der Open Weights sind für die DSGVO nicht dasselbe. Personenbezogene EU-Daten über eine API nach China zu schicken, ist ein Drittlandtransfer mit AVV, Zweckbindung und Löschkonzept. Liegen die Gewichte auf einem von Ihnen kontrollierten Knoten in der EU oder einem angemessenen Drittland, bleibt die Inferenz im eigenen Weisungsbereich — die Parameterzahl ändert daran nichts, der Verarbeitungsweg schon.

3. Zhipu GLM-5.3: Basis bleibt, Post-Training-Rezept wechselt

Entscheidend ist nicht nur die Punktzahl, sondern der Weg: dieselbe 743-Mrd.-Basis wie GLM-5.2, kein neues Vortraining. Allein durch ein größeres Verstärkungslern-Umfeld im Post-Training steigt Terminal-Bench 3.0 von 4,6 % auf 28,3 % — knapp das Sechsfache. Das stützt den Trend der letzten Monate: Wenn Vortraining an den Rändern flacher wird, wird skaliertes Post-Training der günstigere Hebel — und die Schwelle liegt unter einem neuen hundertmilliardenschweren Vortraining. Die Werte bleiben Selbsttests; hinter Sol 34,6 % und Fable 5 33,7 % ist das kein Grund, die Produktion in einem Schritt umzuschalten.

Vergleich: Ist DeepSeek nach der Erhöhung noch das günstigste Flaggschiff?

Umrechnung grob ¥7,15 je 1 USD, nur zur Orientierung; maßgeblich bleibt die offizielle Liste. V4-Pro in der Nebenzeit liegt weiter klar unter Claude Opus 5, ist aber nicht mehr das Feldminimum: Qwen3.8-Max International (2 / 6 USD) und GPT-5.6 Luna (0,20 / 1,20 USD) unterbieten die DeepSeek-Nebenzeit. „Chinesisch = am günstigsten“ löst sich in Schichten auf.

ModellEingabe (je 1 Mio. Token)Ausgabe (je 1 Mio. Token)Open-Weight-Status
DeepSeek V4-Pro (Spitze)¥9,0 (ca. 1,26 USD)¥27,0 (ca. 3,78 USD)Gewichte geschlossen
DeepSeek V4-Pro (Nebenzeit)¥4,5 (ca. 0,63 USD)¥13,5 (ca. 1,89 USD)Gewichte geschlossen
Qwen3.8-Max (International)2 USD6 USDoffen (eigene Lizenz)
OpenAI GPT-5.6 Luna0,20 USD1,20 USDgeschlossen
Claude Opus 5 (aus von Alibaba genannten Vielfachen abgeleitet)ca. 5 USDca. 25 USDgeschlossen

Streitpunkte und ungeprüfte Details

  • Gemischte Anstiegszahlen: „11-fach“, „über 1.100 %“ und „350 %“ sind alle korrekt — aber für Cache-Hit-Eingabe, Ausgabe bzw. Cache-Miss-Eingabe. Die Zeile in der Tabelle entscheidet, nicht die Überschrift.
  • Zhenwu M890: Mehrere chinesische Finanzmedien schreiben, Teile der Qwen3.8-Max-Inferenz liefen auf Alibabas Zhenwu-M890-Chips. Das steht bisher nur in Weitergaben, ohne eigenes Alibaba-Technikdokument und ohne Drittbenchmark. Nicht unabhängig verifiziert.
  • Cursor-Lücke: VentureBeat und Angaben von Zhipu sprechen von einer schweren Cursor-Schwachstelle, die GLM-5.3 gefunden haben soll. Details sind nicht öffentlich; Echtheit und Reichweite sind ungeprüft. Einseitige Herstellerangabe, nicht unabhängig verifiziert.
  • MOFCOM-Gerücht: Einzelne Berichte spekulieren über gegengerichtete Exportkontrollen Chinas bei KI- und Halbleitertechnik. Eine offizielle Bestätigung fehlt. Medienvermutung, nicht unabhängig verifiziert.

Hintergrund: keine Einzelmeldung, sondern eine Zweifronten-Preislogik

Im größeren Bild verdichten chinesische Frontier-Labs den Takt: neben DeepSeek, Alibaba und Zhipu steht Kimi K3 (16. Juli, 2,8 Bio. Parameter offen). Inländische Wirtschaftsmedien lesen das als Open-Weight-Druck, der globale Listen neu setzt.

US-Anbieter gehen den anderen Weg: OpenAI senkt Luna am 30. Juli um 80 % und macht das Modell am 6. und 7. August zum Gratis-Standard; Google halbiert Gemini 3.7 Flash am 13. August. China staffelt und öffnet Flaggschiffe, die USA senken und verschenken Zugang — im August 2026 treffen beide Pfade aufeinander.

Eine geopolitische Lesart: Die Kimi-K3-Freigabe hatte bereits US-Sicherheitsdebatten ausgelöst. Dass Alibaba in diesem Fenster 2,4 Bio. Parameter öffnet, deuten manche als Vorziehen internationaler Reichweite vor einer möglichen Regulierungsenge. Das bleibt eine Interpretation, gehört aber zur Zeitwahl dieser Welle.

Sechs Schritte: Rechnung und Auswahl nach Inkrafttreten

Lassen Sie sich nicht von der Schlagzeilenprozentzahl führen. Diese sechs Schritte machen „wird es teurer?“ zu einer Routing-Entscheidung:

  1. Spitzenfenster markieren: Bestehende Aufrufe nach Pekinger Zeit in 9–12, 14–18 und den Rest teilen; Token-Anteil je Segment zählen.
  2. Positionen trennen: Cache-Hit-Eingabe, Cache-Miss-Eingabe, Ausgabe. Die 1.100 % treffen nur die erste Zeile; Ausgabe plus 350 % trägt die meisten Rechnungen.
  3. Offiziell, Weiterverkauf, Alternativen: In der Spitze ist offizielles DeepSeek nicht automatisch am günstigsten. Parallel Qwen3.8-Max International (2 / 6 USD) und GPT-5.6 Luna (0,20 / 1,20 USD) rechnen.
  4. Lizenztext lesen, nicht die Weiterleitung: Einzelne und interne Nutzung bleiben weitgehend frei. MaaS oder KI-Arbeitsassistent mit über 50 Mio. USD Umsatz in 12 Monaten braucht die Kommerzlizenz.
  5. GLM-5.3 als erste Open-Weight-Liga, nicht als Umschaltbefehl: Selbsttest, keine Drittreproduktion, Terminal-Bench hinter Sol / Fable 5. Kleiner Parallelverkehr, kein Big-Bang.
  6. Nebenzeit-Batches und Open-Weight-Inferenz auf einen dauerhaften Knoten: Ein zugeklapptes Notebook bricht das nächtliche Nebenzeitfenster und die Verfügbarkeit. Für 7×24-Last, lokale Gewichte und Audit-Logs brauchen Sie einen eigenen macOS-Knoten. Personenbezogene EU-Daten: Self-Hosting der Open Weights unter Ihrer Kontrolle ist für DSGVO und Systemstabilität oft der klarere Weg als eine Cloud-API ohne AVV und ohne Löschkonzept.
python
# DeepSeek V4-Pro, grobe Rechnung: nur Ausgabe, Spitze gegen Nebenzeit
# Preise ab 17.08.2026 (CNY je 1 Mio. Token)
PEAK_OUT, OFF_OUT = 27.0, 13.5

def monthly_output_bill(out_tokens_m, peak_share):
    peak = out_tokens_m * peak_share * PEAK_OUT
    off = out_tokens_m * (1 - peak_share) * OFF_OUT
    return round(peak + off, 2)

print(monthly_output_bill(10, 0.8))  # 80 % Spitze → ¥243.0
print(monthly_output_bill(10, 0.2))  # 20 % Spitze → ¥162.0

Drei Zahlen, die Sie zitieren können

  • ca. 1.100 %: V4-Pro Cache-Hit-Eingabe in der Spitze, von ¥0,025 auf ¥0,30 je 1 Mio. Token; absolut klein, als Schlagzeile am größten.
  • 2,4 Bio. / 95 Mrd.: Qwen3.8-2.4T-A95B, 2,4 Bio. gesamt, 95 Mrd. aktiv; Open Weights nativ 262.144 Token, erweiterbar auf ca. 1,01 Mio.
  • 4,6 % → 28,3 %: GLM-5.3 auf derselben 743-Mrd.-Basis, Terminal-Bench 3.0 knapp sechsfach, weiter hinter Sol 34,6 % und Fable 5 33,7 %.

Schluss: Die Preissetzung ist geschichtet — die dauerhafte Rechenkapazität bleibt bei Ihnen

Diese fünf Augusttage legen drei Züge auf dieselbe Liste: DeepSeek schreibt knappe Kapazität in Spitzen- und Nebenzeit, Alibaba tauscht Gewichte gegen Ökosystem und behält über die eigene Lizenz die Verhandlung, Zhipu zeigt, dass Post-Training in die erste Liga reichen kann. Für Teams mit Agenten und offenen Gewichten bleiben drei strukturelle Engpässe:

  • Notebook-Schlaf bricht das Nebenzeitfenster: Deckel zu heißt, die Pekinger Nachtpreise aufzugeben; die Schlagzeilenprozentzahl landet unverändert auf der Rechnung.
  • Geteilte Entwicklermaschine, zu weite Rechte: API-Keys, Gewichtedateien und Batch-Warteschlangen auf demselben schlafenden Rechner — weder Spitze/Nebenzeit noch Lizenz-Audit sind sauber trennbar.
  • Kein 7×24-Kern: Lastverschiebung, lokale Open-Weight-Inferenz und Aufruflogs brauchen einen eigenen Knoten, keine ad-hoc-Funktion, die mit dem Laptop ausgeht.

Wenn Sie Lastverschiebung, Open-Weight-Inferenz und API-Audit in eine stabile, isolierbare Topologie legen wollen, stellen MACCOME Mac-Cloud-Hosts echtes macOS, SSH-Übergabe und eine kontrollierbare Netzgrenze bereit — ausgelegt auf 7×24. Öffentliche Tarife: Mac-mini-Mietpreise.

Quellen: DeepSeek-Preisanzeige, gegencheckt über Wall Street CN, IT Home, AIGC-Navigator und V2EX; Alibaba-Qwen-Modellarchive (Hugging Face / ModelScope) sowie SCMP zur Lizenz; Zhipu (Z.ai) GLM-5.3-Technikseite sowie VentureBeat und StableLearn; Meta-AI-Research-Blog und VentureBeat zu Muse Glimmer; Sammelberichte chinesischer Wirtschaftsmedien zum Veröffentlichungstakt. Stand Redaktionsschluss; Preise, Lizenz und Benchmarks vor einem Produktionswechsel erneut gegen die aktuelle Offizielle prüfen. Zhenwu M890, Cursor-Lücke und MOFCOM-Gerücht sind im Text als nicht unabhängig verifiziert markiert.

Häufige Fragen

Wird DeepSeek nach der Preiserhöhung dauerhaft teurer?

Es kommt auf das Szenario an. Liegen die Aufrufe überwiegend in der Nebenzeit (außerhalb 9–12 und 14–18 Uhr Peking) und ist die Cache-Hit-Rate hoch, bleibt der reale Anstieg deutlich unter den Schlagzeilen von 350 % und 1.100 % — für Intensivnutzer nennen Analysen etwa das 1,8-Fache. Konzentrieren sich die Aufrufe auf die Spitzenfenster bei niedriger Cache-Hit-Rate, nähert sich der Anstieg den Schlagzeilenzahlen. Für 7×24-Nebenzeit-Batches brauchen Sie einen Knoten, der nicht einschläft: MACCOME Mac-mini-Mietpreise.

Dürfen Einzelentwickler Qwen3.8-Max kostenlos kommerziell nutzen?

Einzelentwickler und interner Gebrauch sind weitgehend unberührt. Ist das Geschäft Model-as-a-Service oder ein KI-Arbeitsassistent und hat dieses Geschäft in den letzten 12 Monaten mehr als 50 Mio. USD Umsatz, brauchen Sie eine gesonderte kommerzielle Lizenz von Alibaba. Bei über 100 Mio. MAU oder über 20 Mio. USD Monatsumsatz muss der Modellname in der Oberfläche sichtbar stehen.

Sind GLM-5.3 und GLM-5.2 dasselbe Modell — warum der Sprung?

Die Basis ist identisch (743 Mrd. Parameter); Zhipu hat nicht neu vortrainiert. Der Sprung kommt aus dem Post-Training: die Verstärkungslern-Umgebung wurde deutlich skaliert. Die Zahlen sind Hersteller-Selbsttests ohne unabhängige Drittreproduktion. GLM-5.3 liegt auf Terminal-Bench 3.0 weiter hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %).

Verbietet die Qwen3.8-Max-Lizenz Downloads in den USA oder der EU?

Nein. Das Geo-Verbot ist falsch. Der offizielle Lizenztext enthält keine geografische Sperre. Die Einschränkungen betreffen kommerzielle Dienste oberhalb bestimmter Umsatzschwellen, unabhängig vom Standort.

Bedeutet Muse Glimmer die Rückkehr des Llama-Open-Source-Geists?

Nur teilweise. Muse Glimmer ist ein destilliertes 30-Mrd.-Modell unter Apache 2.0. Das geschlossene Flaggschiff Muse Spark 1.2 ist noch nicht offen; angekündigt sind lediglich künftige Gewichte. Für Open-Weight-Inferenz auf einem dauerhaften Mac: MACCOME Mac-mini-Mietpreise.