Kimi K3 Vollfreigabe: 2,8T Open Weights, KDA und 93,4 % SWE-bench — Was Moonshot am 27. Juli 2026 oeffnete

Ca. 22 Min. Lesezeit · MACCOME · Zuletzt aktualisiert: 28. Juli 2026

Zielgruppe: Tech-Leads, AI-Entwickler und Compliance-Teams, die Open-Weight-Releases quantitativ bewerten. Kernereignis (27.07.2026, 23:00 Uhr Peking): Moonshot AI veroeffentlichte Kimi K3 als Open Weight2,8T Gesamtparameter, ~104B aktiviert, 1M Token Kontext, ~1,56TB Gewichte auf Hugging Face. Sie erhalten: 11-Tage-Timeline API→Weights, KDA-/MoE-Architekturtabelle, Infra-Vergleich, unabhaengige Benchmarks, Lizenzschwellen bei 20 Mio. USD, API-Stufen 0,30 / 3 / 15 USD, 64-GPU-Supernode-Schwelle und 6-Schritte-Runbook inkl. DSGVO-Hinweisen. Ergaenzt die K3-Erstbewertung vom 16.07., die Distillations-Kontroverse und den OpenRouter-Juli-Ranking.

insights

Kurzfassung — 30 Sekunden

  • Kein OSI-Open-Source: Moonshot nutzt durchgaengig open weight; Trainingsdaten und vollstaendiger Trainingscode fehlen.
  • Spezifikation: 2,8T total, 896-of-16 MoE, 1M Kontext, 1,56TB auf Hugging Face — innerhalb 30 Min. Trending #1.
  • Leistung: SWE-bench Verified (Vals AI) 93,4 %; Artificial Analysis Index ~57 — global #3, Open Weight #1.
  • Lizenz: Model-as-a-Service > 20 Mio. USD/12 Monate oder >100 Mio. MAU / >20 Mio. USD Monatsumsatz — zusaetzliche Klauseln.
  • Deployment: Offiziell 64 GPU Supernode minimum; fuer die meisten Teams API oder OpenRouter (7 Provider).

Sechs Fehlinterpretationen nach der K3-Vollfreigabe

  1. Open Weight mit Open Source gleichsetzen: Medien schreiben oft „Open Source“; Moonshot verwendet offiziell nie „open source“ — nur Gewichte, Tech Report und Infra.
  2. Lizenzschwellen ignorieren: Bei MaaS-Umsatz >20 Mio. USD/Jahr oder Super-App-Skala (>100 Mio. MAU) greifen neue Klauseln — relevant fuer API-Wettbewerber und Plattformbetreiber.
  3. Hersteller-Benchmarks unkritisch uebernehmen: Unabhaengige SWE-bench-Reproduktion: K3 93,4 %, nicht die hoechsten Vendor-Zahlen; Claude Opus 5 bleibt bei 97 %.
  4. Nur Faehigkeit, nicht Kosten: K3 ~0,95 USD/Task vs. GLM 5.2 ~0,47 USD — Spitze unter Open Weights, nicht Preis-Leistungs-Sieger.
  5. Self-Hosting unterschaetzen: 2,8T / 896 Experten erfordern laut Moonshot mindestens einen 64-GPU-Supernode; Consumer-Hardware scheidet aus.
  6. Agent-Gateway auf Laptops: 1M-Kontext-Sessions brauchen 7x24-Uptime; Sleep, Jitter und verstreute API-Keys sind Datenschutz- und Verfuegbarkeitsrisiken — unabhaengig von Modellqualitaet.

Timeline und Kerndaten: 11 Tage von API-Launch zu Vollfreigabe

  • 16.07.2026: K3-API-Launch auf kimi.com, Kimi Code und Moonshot API — Gewichte noch geschlossen.
  • 22.–23.07.: US-Seite wirft „industrielle Destillation“ vor; geopolitischer Hintergrund vor WAIC 2026.
  • 27.07.2026, 23:00: Vollstaendige Gewichte, Tech Report; MoonEP und AgentEnv open; FlashKDA bereits veroeffentlicht.
  • 28.07.2026: Medien- und Regierungsreaktionen; Hugging-Face-Trending #1 innerhalb 30 Minuten nach Upload (~1,56TB).
MerkmalWert
Gesamtparameter2,8T
Aktivierte Parameter~104B pro Token
ArchitekturMoE — 896 Routing-Experten, 16 aktiv (+ Shared Experts)
AufmerksamkeitKimi Delta Attention (KDA) + Gated MLA
Kontext1M Token
GewichtsformatMXFP4 Weights + MXFP8 Aktivierungen
Download-Groesse~1,56TB (Hugging Face)
LizenzCustom Open-Weight-Lizenz (kein Modified MIT wie K2)

Architektur und Infra: KDA, AttnRes, MoonEP

K3 ersetzt drei klassische Bausteine: skalares Vergessen in DeltaNet wird durch kanalweise KDA ersetzt (DPLR-Recurrence, linearer Zeitaufwand, niedriger KV-Cache). Attention Residuals (AttnRes) aggregieren fruehere Layer selektiv statt gleichmaessig — ~25 % Trainingseffizienz bei <2 % Overhead. Per-Head Muon optimiert jeden Attention-Head separat (Training-only, API-nicht sichtbar).

KomponenteFunktionKennzahl
KDA (FlashKDA)Linear-Attention-Backend auf CUTLASSPrefill auf H20: 1,72–2,22x vs. Baseline
MoonEPFeingranulares MoE-All-to-AllQuantile Balancing; theoretische Obergrenze redundanter Experten
AgentEnvFirecracker-microVM-Sandbox (KVCache.ai)Checkpoint 133 ms, Restore 49 ms (Herstellerangaben)
Stable LatentMoE896-of-16 RoutingSparsity ~1,8 %; Shared Experts fuer Stabilitaet

Benchmark-Vergleich und Lizenzschwellen

Prioritaet: unabhaengige Reproduktion (Vals AI, Artificial Analysis). Herstellerzahlen nur als Referenz.

ModellSWE-bench VerifiedTypInput / Output (1M)
Claude Opus 597,0 %Geschlossen5 / 25 USD
GPT-5.6 Sol96,2 %Geschlossen
Claude Fable 595,0 %Geschlossen
Kimi K393,4 %Open Weight3 / 15 USD (Cache-Miss)
GLM 5.2Open Weight0,45 / 3,31 USD
DeepSeek V476,2 %Open Weight~0,05–0,14 / ~0,24–0,28 USD

Lizenz — zwei kommerzielle Schwellen: (1) Model-as-a-Service mit >20 Mio. USD Umsatz in 12 Monaten — separate Vereinbarung mit Moonshot. (2) >100 Mio. MAU oder >20 Mio. USD Monatsumsatz — sichtbare „Kimi K3“-Attribution in der UI. Fuer KMU und interne Nutzung typischerweise unproblematisch.

DSGVO: Wenn EU-Personendaten in Prompts landen, pruefen Sie Datenresidenz, AVV und Subprocessor-Liste bei Moonshot API vs. Self-Hosting vs. OpenRouter-Provider. Open Weights allein loesen keine Compliance — der Verarbeitungsort und der Betreiber zaehlen.

API-Preise und Kostenvergleich

Token-TypPreis pro 1MAnmerkung
Input (Cache Hit)0,30 USDMooncake-Architektur: >90 % Hit-Rate bei Code-Workloads
Input (Cache Miss)3,00 USDVoller Prefill
Output (inkl. Reasoning)15,00 USDAgent-Loops: Output dominiert

Endpoint: https://api.moonshot.ai/v1, Modell-ID kimi-k3, OpenAI-SDK-kompatibel. Rechenbeispiel Agent-Loop (1M Input + 3M Output, Cache-Miss): K3 ~48 USD; DeepSeek V4 Flash ~0,90–1,50 USD; Claude Opus 5 ~80 USD.

python
from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "Senior engineer. Type hints required."},
        {"role": "user", "content": "Refactor this module for SWE-bench style tasks."},
    ],
    max_tokens=4096,
)
print(resp.choices[0].message.content)
warning

Produktionshinweis: Self-Hosting unter 64 GPUs ist laut Moonshot nicht vorgesehen. Wenn personenbezogene Daten verarbeitet werden, dokumentieren Sie den API-Pfad in der VVT — nicht nur Modellfaehigkeit.

Sechs-Schritte-Runbook und Produktionsbetrieb

  1. Lizenz und Use Case pruefen: MaaS-Umsatz, MAU und Monatsumsatz gegen 20-Mio.-USD-Schwellen; Legal bei Konkurrenz zu Moonshot API einbinden.
  2. Zugangsweg waehlen: Offizielle API (Cache-Vorteil), OpenRouter mit Fallback-Kette — siehe OpenRouter-API-Guide.
  3. Task-basiertes Routing: Bulk/Code → DeepSeek V4 Flash; Agent/Programmierung → K3 max; kritisch → Claude Opus 5 — vgl. Juli-Routing-Matrix.
  4. Eigene Workloads benchmarken: Interne SWE-Subset oder Coding-Tasks; K3 vs. GLM 5.2 Kostenkurve messen — Vermeidung von Over-Provisioning.
  5. Agent-Gateway deployen: OpenClaw / Hermes / Kilo Code auf dediziertem Host; API-Keys pro Umgebung; 429/Timeout-Fallback konfigurieren.
  6. 7x24-Monitoring und DSGVO: Tagesbudget, Cache-Hit-Rate, Subprocessor-Liste; kein Gratis-Tier fuer personenbezogene Daten. Host: MACCOME Mietpreise.

Drei Zahlen fuer das Tech-Review

  • Erstes vollstaendig offenes 3T-Modell: 2,8T, 1,56TB, Hugging Face Trending #1 in 30 Minuten.
  • 93,4 % SWE-bench (Vals AI): +17,2 PP gegenueber DeepSeek V4 (76,2 %); -3,6 PP gegenueber Opus 5 (97 %).
  • API-Effektivpreis: Mit 90 %+ Cache-Hit oft nahe 0,30 USD Input — Output bei 15 USD bleibt der Agent-Kostenhebel.

Fuer die meisten Teams ist Self-Hosting unrealistisch; produktionsreife Agent-Stacks brauchen dennoch einen always-on-Knoten. MACCOME Mac-Cloud liefert echtes macOS, SSH-Uebergabe und Umgebungsisolation fuer stabiles K3-Routing — Mietpreise und Konfiguration.

Quellen: Moonshot AI Blog, Hugging Face (moonshotai), GitHub FlashKDA, Vals AI SWE-bench, Artificial Analysis. Stand 28.07.2026.

FAQ

Ist Kimi K3 Open Source?

Nein im OSI-Sinn. Es ist open weight: Gewichte, Tech Report und Teile der Infra sind oeffentlich; Trainingsdaten und vollstaendiger Trainingscode nicht.

Welche Lizenzschwellen gelten ab 20 Mio. USD?

MaaS-Umsatz >20 Mio. USD in 12 Monaten erfordert eine separate Moonshot-Vereinbarung. Bei >100 Mio. MAU oder >20 Mio. USD Monatsumsatz ist „Kimi K3“-Attribution in der Produkt-UI vorgeschrieben.

Wie viele GPUs fuer Self-Hosting?

Moonshot empfiehlt mindestens einen 64-GPU-Supernode. Details in der Erstbewertung vom 16.07.

Was bedeutet SWE-bench 93,4 %?

Unabhaengige Vals-AI-Reproduktion auf SWE-bench Verified — Spitze unter Open Weights, unter frontier closed models. Kontext: Distillations-Debatte.

Welche DSGVO-Risiken hat die K3-API?

Datenresidenz, AVV und Subprocessor bei Moonshot oder OpenRouter-Provider pruefen. Keine personenbezogenen EU-Daten ohne dokumentierte Rechtsgrundlage und geeigneten Verarbeitungsort.

Wie betreibe ich K3-Agenten 7x24?

Gateway auf dediziertem Mac-Cloud-Host; siehe MACCOME Mac-mini-Mietpreise fuer M4/M4-Pro-Knoten.