Alibaba Qwen3.8-Max: 2,4T Parameter, Arena Top 5 — Open-Source-Label vor den Gewichten

ca. 16 Min. Lesezeit · MACCOME · Zuletzt aktualisiert: 4. August 2026

Zielgruppe: Entwickler und Tech-Leads, die chinesische Frontier-Modelle, Agent-Kosten und Open-Source-Glaubwuerdigkeit bewerten. Am 3. August 2026 hat Alibaba Qwen3.8-Max GA verkuendet (2,4T gesamt / 950B aktiv, 1M Kontext), parallel zum Agent-Produkt „Qwen Office“ — Arena Text Platz 5, aber alle Benchmarks sind Alibaba-intern, und das Open-Source-Label steht ohne veroeffentlichte Gewichte. Sie erhalten: Timeline, Kerndatentabelle, Vergleich Kimi K3 / DeepSeek V4, Open-Source-Kontroverse, 6-Schritte-Runbook und FAQ. Struktur: Risiken → Timeline → Architektur → Wettbewerb → Kontroverse → Runbook → Fazit. Kimi-K3-Hintergrund: Kimi K3 Vollfreigabe.

bolt

TL;DR — 30 Sekunden

  • 03.08. GA: Qwen3.8-Max API live, $2/$6 pro 1M (Input/Output) — unter Claude Opus 5 und Fable 5; „Qwen Office“ konkurriert mit Tencent WorkBuddy und Kimi Work.
  • Arena Platz 5: Text 1496 Punkte (Preliminary), einziges Nicht-Anthropic-Modell in Top 8; Vision Platz 2 hinter Fable 5.
  • Open Source fehlt: qwen.ai traegt „Open-Source“, Hugging Face / ModelScope leer — Gewichte fuer ca. 10.08. angekuendigt (Qwen3.8-Max + Qwen3.8-27B).
  • Wettbewerb: Blindtest Kimi K3 83 vs. Qwen Preview 80 — kein klares Ueberlegen, segmentgleich.

Sechs Risikofaktoren: typische Fehlentscheidungen in der Release-Woche

  1. Wenn „Open-Source“ auf qwen.ai steht, dann nicht automatisch annehmen, dass Gewichte verfuegbar sind — Stand 04.08. kein HF-Repo, keine Lizenz.
  2. Wenn PaperBench 93,0 oder OSWorld 86,1 zitiert werden, dann als Alibaba-intern einstufen — Artificial Analysis hat GA noch nicht reproduziert.
  3. Wenn die Preview (19.07.) ohne Aktivparameter kam, dann Transparenzluecke dokumentieren — 950B erst mit GA nachgereicht.
  4. Wenn 2,4T als lokale Deploy-Kosten genutzt wird, dann auf 950B Aktivparameter umrechnen — MoE-Inferenz folgt der Aktivierung, nicht dem Gesamtvolumen.
  5. Wenn Preview-ToS Produktionsautomatisierung verbiet, dann vor GA-Migration A/B gegen Kimi K3 oder Claude Opus 5 fahren — nicht blind umschalten.
  6. Wenn 16-Tage-Agent-Showcases auf dem Laptop laufen, dann mit Sleep-Unterbrechung rechnen — 7x24 erfordert dedizierten Host; Datenschutz: keine EU-Personendaten ohne AVV auf unsicheren Tiers.

Timeline: Preview bis GA in zwei Wochen

  • 16.07.: Moonshot veroeffentlicht Kimi K3 (2,8T, 16/896 Experten aktiv) mit Tech Report und unabhaengigen Reviews.
  • 19.07.: Qwen3.8-Max Preview auf Token Plan / Qoder / QoderWork — 10 % des Endpreises, ohne Aktivparameter und Benchmark-Tabelle.
  • 27.07.: Kimi K3 Gewichte auf Hugging Face.
  • 31.07.: DeepSeek V4-Flash GA — 9 Agent/Code-Benchmarks ueber V4-Pro Preview ohne Parameter-Inflation.
  • 03.08.: Qwen3.8-Max GA, vollstaendige Benchmark-Tabelle, „Qwen Office“ live; Alibaba-Aktien +7 % HK / +4,5 % US.
  • ca. 10.08.: Geplante Gewichte Qwen3.8-Max und Qwen3.8-27B auf Hugging Face / ModelScope — Datum und Lizenz offen.
FeldQwen3.8-Max
Release2026-08-03 (GA)
Gesamt / aktiv2,4T / 950B
ArchitekturSparse MoE auf Qwen3.5-Basis + Hybrid-Attention
Kontext1M Token (Thinking ~983k, Output max ~131k)
API (international)Input $2 / Output $6 pro 1M
Arena Text (01.08.)Platz 5, 1496 (Preliminary)
PaperBench (Alibaba)93,0 (+28,2 gg. Vorgaenger)
SWE-bench Pro (Alibaba)67,7 (Fable 5: 80,0)
Open WeightVersprochen, Stand 04.08. nicht live

Architektur: MoE-Effizienz statt reiner Parameter-Inflation

Wenn MoE + Hybrid-Attention, dann Preisdruck auf API-Ebene

2,4T gesamt bei 950B Aktivierung — Inferenzkosten nahe an Hundert-Milliarden-Modellen, nicht an voller 2,4T-Materialisierung. Das traegt die API-Preise $2/$6 vs. Claude Opus 5 ($5/$25) und Fable 5 ($10/$50): Effizienz als Preishebel.

reasoning_effort: low / medium / xhigh

Steuerung ueber enable_thinking oder Anthropic-kompatibles reasoning.effort — Wenn Task trivial, dann low/medium; wenn Agent mit Langstrecke, dann xhigh und Token-Baseline messen.

Langstrecken-Showcases: starke Story, schwache externe Auditierbarkeit

16 Tage autonomes Coding, 500+ Schritte Chip-Design, RecreationBench — teils auf GitHub qwen-code-dev-bot/oh-my-cli, aber keine vollstaendige Drittpruefung.

Oekosystem: Modell plus Agent-Produkt

„Qwen Office“ plus OpenAI- und Anthropic-kompatible API — Anbindung an Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw. Wenn EU-Daten verarbeitet werden: Subprocessor-Liste und AVV bei QwenCloud pruefen, nicht nur Modellqualitaet.

ModellAnbieterGesamt/aktivPreis in/out pro 1MOpen WeightDrittbewertung
Qwen3.8-MaxAlibaba2,4T / 950B$2 / $6AusstehendKeine GA-Repro
Kimi K3Moonshot2,8T / ~500B$3 / $15Ja (27.07.)Artificial Analysis ~57,11
DeepSeek V4-FlashDeepSeekwie V4-Pronicht voll publ.Ja9 Benchmarks > V4-Pro
Claude Fable 5Anthropicunbekannt$10 / $50NeinArena Text #1
Claude Opus 5Anthropicunbekannt$5 / $25NeinArena Spitze

Kontroverse: Open-Source-Label vor Gewichten

  1. Label vs. Artefakt: GA-Tag „Open-Source“, kein HF/ModelScope-Repo — nur „naechste Woche“.
  2. Benchmark-Herkunft: QwenSWEBench, RecreationBench etc. — Alibaba-eigene Frameworks; neutrale Plattformen ohne GA-Replikation.
  3. Wettbewerbs-Footnotes: Hinweis „Fable 5 moeglicherweise Fallback“ ohne gleichwertige Methodenoffenlegung.
  4. Preview-Transparenz: 19.07. Produktionsverbot fuer Automation, kein Model Card — unabhaengige Stellen empfehlen A/B vor Migration.

Das disqualifiziert Qwen3.8-Max nicht — Blindtest (269 Architektur-Dateien): K3 83, Qwen Preview 80. Behauptungen wie „klar ueber GPT-5.6 Sol und Fable 5“ bleiben bis Gewichte und Dritt-Repro ohne belastbare Basis.

Marktkontext: Parameter-Rennen und Effizienz-Rennen parallel

  • Trillionen-Skalierung: DeepSeek V4-Pro (1,6T) → Qwen3.8-Max (2,4T) → Kimi K3 (2,8T); V4-Flash zeigt Agent-Gewinne ohne reines Scaling.
  • Alibaba kehrt zu Open Weight zurueck: erstmals Max-Tier versprochen — neben K3 und DeepSeek.
  • Consumer: Qwen ueber Apple Intelligence China systemweit auf iPhone — Reichweite jenseits API.
  • Regulatorik: 04.08. White House mit OpenAI, Anthropic, Google, Meta zu Agent-Security-Tests — Kontrast zu beschleunigter Open-Weight-Landschaft in CN.

Sechs-Schritte-Runbook: nach dem GA-Release

  1. API vs. Produktion trennen: Preview verbot Automation — GA: A/B mit Kimi K3 oder Opus 5 auf nicht-kritischem Traffic.
  2. reasoning_effort nach Task: low/medium fuer Routine; xhigh fuer Agent — Token-Baseline protokollieren.
  3. Endpoint-Kompatibilitaet: Bei Claude Code / OpenClaw Anthropic-Endpoint testen; Cache implizit $0,25, explizit read $0,17 pro 1M.
  4. Evidence-Tiers: Alibaba-intern → Arena Preliminary → Blindtest — nach 10.08. Identity- und Benchmark-Repro.
  5. Langstrecken-Agent auf dediziertem Host: OpenClaw Gateway + Qwen3.8-Max API — kein Laptop-Sleep; Keys pro Umgebung (Datenschutz).
  6. Post-10.08. Open-Weight-Check: HF-Repo, Lizenz, Qwen3.8-27B fuer On-Prem — interne Routing-Tabelle aktualisieren.

Drei Zahlen fuer das Tech-Review

  • Preisspread: $2/$6 vs. Opus 5 ($5/$25) Input ~40 %, vs. Fable 5 ($10/$50) ~20 % — 950B Aktivierung als Kostentreiber.
  • Arena Text #5 / Vision #2: 1496 (Preliminary), einziges Nicht-Anthropic in Top 8 — beide Raenge vorlaeufig.
  • Blindtest: K3 83 vs. Qwen Preview 80 — 3 Punkte, gleiches Segment.

Fazit: erst verifizieren, dann migrieren

Qwen3.8-Max bringt Alibaba zurueck ins Frontier-Narrativ: 2,4T MoE, Arena Top 5, Qwen Office — aber Open-Source-Label ohne Gewichte und fehlende Dritt-Repro erfordern API-Test → Evidence-Tiers → Produktionsmigration.

Wenn Qwen3.8-Max + OpenClaw + Multi-Provider-Fallback auf dem Laptop laeuft: Sleep, Netzwerk-Jitter und verstreute Keys sind versteckte Kosten. Fuer 7x24-Gateway und Langstrecken-Agenten liefert MACCOME Mac Cloud echtes macOS, SSH-Uebergabe und Umgebungsisolation — OpenClaw und Qoder CLI stabil auf dedizierter Instanz. Konfiguration und Preise: Mac-mini-Mietpreise.

Quellen: Alibaba-Offizielle, Arena.ai (01.08.2026), Apidog, TechNode, SiliconANGLE. Alibaba-Benchmarks als „intern“ markiert — vor Deployment aktuelle Open-Weight-Timeline pruefen.

FAQ

Ist Qwen3.8-Max jetzt nutzbar? Open source?

API ueber QwenCloud, OpenAI- und Anthropic-kompatibel. Gewichte noch nicht veroeffentlicht — Hugging Face / ModelScope ca. 10.08., offizielle Ankuendigung massgeblich.

Qwen3.8-Max oder Kimi K3 — wer ist staerker?

Kein einheitlicher Benchmark. Blindtest: K3 83, Qwen Preview 80. K3: open weight + Drittdaten; Qwen: guenstigere API, breiteres Multimodal. Siehe Kimi-K3-Erstbewertung.

Sind 2,4T fuer normale Teams zu gross?

API folgt 950B Aktivierung — Kosten nahe Hundert-Milliarden-Klasse. Vollstaendiges Self-Hosting braucht Multi-Node-Rechenzentrum; realistischer: Qwen3.8-27B nach Open Weight.

Alibaba-Benchmarks vertrauenswuerdig?

Als Referenz ja, als Endurteil nein — interne Frameworks, keine GA-Repro durch neutrale Plattformen. Eigene A/B oder abwartende Drittbewertung empfohlen.

Qwen3.8-Max-Agenten 7x24 produktiv — wie?

Gateway und Multi-Provider-Routing auf dediziertem Mac-Cloud-Host. MACCOME Mac-mini-Mietpreise fuer Knoten und Konfiguration.