Zielgruppe: Tech-Leads, AI-Entwickler und Compliance-Teams, die Open-Weight-Releases quantitativ bewerten. Kernereignis (27.07.2026, 23:00 Uhr Peking): Moonshot AI veroeffentlichte Kimi K3 als Open Weight — 2,8T Gesamtparameter, ~104B aktiviert, 1M Token Kontext, ~1,56TB Gewichte auf Hugging Face. Sie erhalten: 11-Tage-Timeline API→Weights, KDA-/MoE-Architekturtabelle, Infra-Vergleich, unabhaengige Benchmarks, Lizenzschwellen bei 20 Mio. USD, API-Stufen 0,30 / 3 / 15 USD, 64-GPU-Supernode-Schwelle und 6-Schritte-Runbook inkl. DSGVO-Hinweisen. Ergaenzt die K3-Erstbewertung vom 16.07., die Distillations-Kontroverse und den OpenRouter-Juli-Ranking.
Kurzfassung — 30 Sekunden
| Merkmal | Wert |
|---|---|
| Gesamtparameter | 2,8T |
| Aktivierte Parameter | ~104B pro Token |
| Architektur | MoE — 896 Routing-Experten, 16 aktiv (+ Shared Experts) |
| Aufmerksamkeit | Kimi Delta Attention (KDA) + Gated MLA |
| Kontext | 1M Token |
| Gewichtsformat | MXFP4 Weights + MXFP8 Aktivierungen |
| Download-Groesse | ~1,56TB (Hugging Face) |
| Lizenz | Custom Open-Weight-Lizenz (kein Modified MIT wie K2) |
K3 ersetzt drei klassische Bausteine: skalares Vergessen in DeltaNet wird durch kanalweise KDA ersetzt (DPLR-Recurrence, linearer Zeitaufwand, niedriger KV-Cache). Attention Residuals (AttnRes) aggregieren fruehere Layer selektiv statt gleichmaessig — ~25 % Trainingseffizienz bei <2 % Overhead. Per-Head Muon optimiert jeden Attention-Head separat (Training-only, API-nicht sichtbar).
| Komponente | Funktion | Kennzahl |
|---|---|---|
| KDA (FlashKDA) | Linear-Attention-Backend auf CUTLASS | Prefill auf H20: 1,72–2,22x vs. Baseline |
| MoonEP | Feingranulares MoE-All-to-All | Quantile Balancing; theoretische Obergrenze redundanter Experten |
| AgentEnv | Firecracker-microVM-Sandbox (KVCache.ai) | Checkpoint 133 ms, Restore 49 ms (Herstellerangaben) |
| Stable LatentMoE | 896-of-16 Routing | Sparsity ~1,8 %; Shared Experts fuer Stabilitaet |
Prioritaet: unabhaengige Reproduktion (Vals AI, Artificial Analysis). Herstellerzahlen nur als Referenz.
| Modell | SWE-bench Verified | Typ | Input / Output (1M) |
|---|---|---|---|
| Claude Opus 5 | 97,0 % | Geschlossen | 5 / 25 USD |
| GPT-5.6 Sol | 96,2 % | Geschlossen | — |
| Claude Fable 5 | 95,0 % | Geschlossen | — |
| Kimi K3 | 93,4 % | Open Weight | 3 / 15 USD (Cache-Miss) |
| GLM 5.2 | — | Open Weight | 0,45 / 3,31 USD |
| DeepSeek V4 | 76,2 % | Open Weight | ~0,05–0,14 / ~0,24–0,28 USD |
Lizenz — zwei kommerzielle Schwellen: (1) Model-as-a-Service mit >20 Mio. USD Umsatz in 12 Monaten — separate Vereinbarung mit Moonshot. (2) >100 Mio. MAU oder >20 Mio. USD Monatsumsatz — sichtbare „Kimi K3“-Attribution in der UI. Fuer KMU und interne Nutzung typischerweise unproblematisch.
DSGVO: Wenn EU-Personendaten in Prompts landen, pruefen Sie Datenresidenz, AVV und Subprocessor-Liste bei Moonshot API vs. Self-Hosting vs. OpenRouter-Provider. Open Weights allein loesen keine Compliance — der Verarbeitungsort und der Betreiber zaehlen.
| Token-Typ | Preis pro 1M | Anmerkung |
|---|---|---|
| Input (Cache Hit) | 0,30 USD | Mooncake-Architektur: >90 % Hit-Rate bei Code-Workloads |
| Input (Cache Miss) | 3,00 USD | Voller Prefill |
| Output (inkl. Reasoning) | 15,00 USD | Agent-Loops: Output dominiert |
Endpoint: https://api.moonshot.ai/v1, Modell-ID kimi-k3, OpenAI-SDK-kompatibel. Rechenbeispiel Agent-Loop (1M Input + 3M Output, Cache-Miss): K3 ~48 USD; DeepSeek V4 Flash ~0,90–1,50 USD; Claude Opus 5 ~80 USD.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": "Senior engineer. Type hints required."},
{"role": "user", "content": "Refactor this module for SWE-bench style tasks."},
],
max_tokens=4096,
)
print(resp.choices[0].message.content)
Produktionshinweis: Self-Hosting unter 64 GPUs ist laut Moonshot nicht vorgesehen. Wenn personenbezogene Daten verarbeitet werden, dokumentieren Sie den API-Pfad in der VVT — nicht nur Modellfaehigkeit.
Fuer die meisten Teams ist Self-Hosting unrealistisch; produktionsreife Agent-Stacks brauchen dennoch einen always-on-Knoten. MACCOME Mac-Cloud liefert echtes macOS, SSH-Uebergabe und Umgebungsisolation fuer stabiles K3-Routing — Mietpreise und Konfiguration.
Quellen: Moonshot AI Blog, Hugging Face (moonshotai), GitHub FlashKDA, Vals AI SWE-bench, Artificial Analysis. Stand 28.07.2026.
FAQ
Ist Kimi K3 Open Source?
Nein im OSI-Sinn. Es ist open weight: Gewichte, Tech Report und Teile der Infra sind oeffentlich; Trainingsdaten und vollstaendiger Trainingscode nicht.
Welche Lizenzschwellen gelten ab 20 Mio. USD?
MaaS-Umsatz >20 Mio. USD in 12 Monaten erfordert eine separate Moonshot-Vereinbarung. Bei >100 Mio. MAU oder >20 Mio. USD Monatsumsatz ist „Kimi K3“-Attribution in der Produkt-UI vorgeschrieben.
Wie viele GPUs fuer Self-Hosting?
Moonshot empfiehlt mindestens einen 64-GPU-Supernode. Details in der Erstbewertung vom 16.07.
Was bedeutet SWE-bench 93,4 %?
Unabhaengige Vals-AI-Reproduktion auf SWE-bench Verified — Spitze unter Open Weights, unter frontier closed models. Kontext: Distillations-Debatte.
Welche DSGVO-Risiken hat die K3-API?
Datenresidenz, AVV und Subprocessor bei Moonshot oder OpenRouter-Provider pruefen. Keine personenbezogenen EU-Daten ohne dokumentierte Rechtsgrundlage und geeigneten Verarbeitungsort.
Wie betreibe ich K3-Agenten 7x24?
Gateway auf dediziertem Mac-Cloud-Host; siehe MACCOME Mac-mini-Mietpreise fuer M4/M4-Pro-Knoten.