Alibaba Qwen3.8-Max: 2,4T Parameter, Arena Top 5 — Open-Source-Label vor den Gewichten
ca. 16 Min. Lesezeit·MACCOME·Zuletzt aktualisiert: 4. August 2026
Zielgruppe: Entwickler und Tech-Leads, die chinesische Frontier-Modelle, Agent-Kosten und Open-Source-Glaubwuerdigkeit bewerten. Am 3. August 2026 hat Alibaba Qwen3.8-Max GA verkuendet (2,4T gesamt / 950B aktiv, 1M Kontext), parallel zum Agent-Produkt „Qwen Office“ — Arena Text Platz 5, aber alle Benchmarks sind Alibaba-intern, und das Open-Source-Label steht ohne veroeffentlichte Gewichte. Sie erhalten: Timeline, Kerndatentabelle, Vergleich Kimi K3 / DeepSeek V4, Open-Source-Kontroverse, 6-Schritte-Runbook und FAQ. Struktur: Risiken → Timeline → Architektur → Wettbewerb → Kontroverse → Runbook → Fazit. Kimi-K3-Hintergrund: Kimi K3 Vollfreigabe.
bolt
TL;DR — 30 Sekunden
03.08. GA: Qwen3.8-Max API live, $2/$6 pro 1M (Input/Output) — unter Claude Opus 5 und Fable 5; „Qwen Office“ konkurriert mit Tencent WorkBuddy und Kimi Work.
Arena Platz 5: Text 1496 Punkte (Preliminary), einziges Nicht-Anthropic-Modell in Top 8; Vision Platz 2 hinter Fable 5.
Open Source fehlt: qwen.ai traegt „Open-Source“, Hugging Face / ModelScope leer — Gewichte fuer ca. 10.08. angekuendigt (Qwen3.8-Max + Qwen3.8-27B).
Wettbewerb: Blindtest Kimi K3 83 vs. Qwen Preview 80 — kein klares Ueberlegen, segmentgleich.
Sechs Risikofaktoren: typische Fehlentscheidungen in der Release-Woche
Wenn „Open-Source“ auf qwen.ai steht, dann nicht automatisch annehmen, dass Gewichte verfuegbar sind — Stand 04.08. kein HF-Repo, keine Lizenz.
Wenn PaperBench 93,0 oder OSWorld 86,1 zitiert werden, dann als Alibaba-intern einstufen — Artificial Analysis hat GA noch nicht reproduziert.
Wenn die Preview (19.07.) ohne Aktivparameter kam, dann Transparenzluecke dokumentieren — 950B erst mit GA nachgereicht.
Wenn 2,4T als lokale Deploy-Kosten genutzt wird, dann auf 950B Aktivparameter umrechnen — MoE-Inferenz folgt der Aktivierung, nicht dem Gesamtvolumen.
Wenn Preview-ToS Produktionsautomatisierung verbiet, dann vor GA-Migration A/B gegen Kimi K3 oder Claude Opus 5 fahren — nicht blind umschalten.
Wenn 16-Tage-Agent-Showcases auf dem Laptop laufen, dann mit Sleep-Unterbrechung rechnen — 7x24 erfordert dedizierten Host; Datenschutz: keine EU-Personendaten ohne AVV auf unsicheren Tiers.
Timeline: Preview bis GA in zwei Wochen
16.07.: Moonshot veroeffentlicht Kimi K3 (2,8T, 16/896 Experten aktiv) mit Tech Report und unabhaengigen Reviews.
19.07.: Qwen3.8-Max Preview auf Token Plan / Qoder / QoderWork — 10 % des Endpreises, ohne Aktivparameter und Benchmark-Tabelle.
27.07.: Kimi K3 Gewichte auf Hugging Face.
31.07.: DeepSeek V4-Flash GA — 9 Agent/Code-Benchmarks ueber V4-Pro Preview ohne Parameter-Inflation.
Wenn MoE + Hybrid-Attention, dann Preisdruck auf API-Ebene
2,4T gesamt bei 950B Aktivierung — Inferenzkosten nahe an Hundert-Milliarden-Modellen, nicht an voller 2,4T-Materialisierung. Das traegt die API-Preise $2/$6 vs. Claude Opus 5 ($5/$25) und Fable 5 ($10/$50): Effizienz als Preishebel.
reasoning_effort: low / medium / xhigh
Steuerung ueber enable_thinking oder Anthropic-kompatibles reasoning.effort — Wenn Task trivial, dann low/medium; wenn Agent mit Langstrecke, dann xhigh und Token-Baseline messen.
16 Tage autonomes Coding, 500+ Schritte Chip-Design, RecreationBench — teils auf GitHub qwen-code-dev-bot/oh-my-cli, aber keine vollstaendige Drittpruefung.
Oekosystem: Modell plus Agent-Produkt
„Qwen Office“ plus OpenAI- und Anthropic-kompatible API — Anbindung an Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw. Wenn EU-Daten verarbeitet werden: Subprocessor-Liste und AVV bei QwenCloud pruefen, nicht nur Modellqualitaet.
Modell
Anbieter
Gesamt/aktiv
Preis in/out pro 1M
Open Weight
Drittbewertung
Qwen3.8-Max
Alibaba
2,4T / 950B
$2 / $6
Ausstehend
Keine GA-Repro
Kimi K3
Moonshot
2,8T / ~500B
$3 / $15
Ja (27.07.)
Artificial Analysis ~57,11
DeepSeek V4-Flash
DeepSeek
wie V4-Pro
nicht voll publ.
Ja
9 Benchmarks > V4-Pro
Claude Fable 5
Anthropic
unbekannt
$10 / $50
Nein
Arena Text #1
Claude Opus 5
Anthropic
unbekannt
$5 / $25
Nein
Arena Spitze
Kontroverse: Open-Source-Label vor Gewichten
Label vs. Artefakt: GA-Tag „Open-Source“, kein HF/ModelScope-Repo — nur „naechste Woche“.
Benchmark-Herkunft: QwenSWEBench, RecreationBench etc. — Alibaba-eigene Frameworks; neutrale Plattformen ohne GA-Replikation.
Wettbewerbs-Footnotes: Hinweis „Fable 5 moeglicherweise Fallback“ ohne gleichwertige Methodenoffenlegung.
Preview-Transparenz: 19.07. Produktionsverbot fuer Automation, kein Model Card — unabhaengige Stellen empfehlen A/B vor Migration.
Das disqualifiziert Qwen3.8-Max nicht — Blindtest (269 Architektur-Dateien): K3 83, Qwen Preview 80. Behauptungen wie „klar ueber GPT-5.6 Sol und Fable 5“ bleiben bis Gewichte und Dritt-Repro ohne belastbare Basis.
Marktkontext: Parameter-Rennen und Effizienz-Rennen parallel
Trillionen-Skalierung: DeepSeek V4-Pro (1,6T) → Qwen3.8-Max (2,4T) → Kimi K3 (2,8T); V4-Flash zeigt Agent-Gewinne ohne reines Scaling.
Alibaba kehrt zu Open Weight zurueck: erstmals Max-Tier versprochen — neben K3 und DeepSeek.
Qwen3.8-Max bringt Alibaba zurueck ins Frontier-Narrativ: 2,4T MoE, Arena Top 5, Qwen Office — aber Open-Source-Label ohne Gewichte und fehlende Dritt-Repro erfordern API-Test → Evidence-Tiers → Produktionsmigration.
Wenn Qwen3.8-Max + OpenClaw + Multi-Provider-Fallback auf dem Laptop laeuft: Sleep, Netzwerk-Jitter und verstreute Keys sind versteckte Kosten. Fuer 7x24-Gateway und Langstrecken-Agenten liefert MACCOME Mac Cloud echtes macOS, SSH-Uebergabe und Umgebungsisolation — OpenClaw und Qoder CLI stabil auf dedizierter Instanz. Konfiguration und Preise: Mac-mini-Mietpreise.
Quellen: Alibaba-Offizielle, Arena.ai (01.08.2026), Apidog, TechNode, SiliconANGLE. Alibaba-Benchmarks als „intern“ markiert — vor Deployment aktuelle Open-Weight-Timeline pruefen.
FAQ
Ist Qwen3.8-Max jetzt nutzbar? Open source?
API ueber QwenCloud, OpenAI- und Anthropic-kompatibel. Gewichte noch nicht veroeffentlicht — Hugging Face / ModelScope ca. 10.08., offizielle Ankuendigung massgeblich.
API folgt 950B Aktivierung — Kosten nahe Hundert-Milliarden-Klasse. Vollstaendiges Self-Hosting braucht Multi-Node-Rechenzentrum; realistischer: Qwen3.8-27B nach Open Weight.
Alibaba-Benchmarks vertrauenswuerdig?
Als Referenz ja, als Endurteil nein — interne Frameworks, keine GA-Repro durch neutrale Plattformen. Eigene A/B oder abwartende Drittbewertung empfohlen.
Qwen3.8-Max-Agenten 7x24 produktiv — wie?
Gateway und Multi-Provider-Routing auf dediziertem Mac-Cloud-Host. MACCOME Mac-mini-Mietpreise fuer Knoten und Konfiguration.