Kimi K3 en open weight : 2,8T parametres, KDA et 93,4 % SWE-bench — ce que Moonshot a ouvert le 27 juillet 2026

Environ 22 min de lecture · MACCOME · Derniere mise a jour : 28 juillet 2026

Public cible : responsables techniques, developpeurs et equipes juridiques qui evaluent les releases open weight avec rigueur. Fait marquant (27 juillet 2026, 23h Pekin) : Moonshot AI publie Kimi K3 en open weight2,8T parametres totaux, ~104B actives, 1M tokens de contexte, ~1,56 To sur Hugging Face. Ce que vous obtenez : chronologie API→poids en 11 jours, tableaux architecture KDA/MoE et infra, benchmarks independants, seuils de licence a 20 M USD, tarification API 0,30 / 3 / 15 USD, seuil super-nœud 64 GPU et runbook en six etapes. Suite de notre premiere analyse du 16 juillet, de la controverse sur la distillation et du classement OpenRouter de juillet.

insights

Synthese — 30 secondes

  • Pas un open source OSI : Moonshot emploie exclusivement open weight ; donnees et code d'entrainement complets absents.
  • Specifications : 2,8T total, MoE 896-of-16, 1M de contexte, 1,56 To sur Hugging Face — trending #1 en 30 minutes.
  • Performance : SWE-bench Verified (Vals AI) 93,4 % ; indice Artificial Analysis ~57 — #3 mondial, #1 open weight.
  • Licence : MaaS > 20 M USD sur 12 mois ou >100 M MAU / >20 M USD de revenus mensuels — clauses additionnelles.
  • Deploiement : minimum officiel 64 GPU ; pour la plupart des equipes, API ou OpenRouter (7 fournisseurs).

Six erreurs d'interpretation apres la liberation des poids K3

  1. Confondre open weight et open source : la presse parle souvent d'« open source » ; Moonshot n'utilise jamais officiellement ce terme — seulement poids, rapport technique et infra.
  2. Negliger les seuils de licence : au-dela de 20 M USD de revenus MaaS ou d'une echelle super-app (>100 M MAU), de nouvelles obligations s'appliquent — critique pour les concurrents API.
  3. Accepter les benchmarks editeur sans verification : reproduction independante SWE-bench : K3 a 93,4 %, pas les chiffres marketing les plus eleves ; Claude Opus 5 reste a 97 %.
  4. Ne regarder que la capacite, pas le cout : K3 ~0,95 USD/tache vs GLM 5.2 ~0,47 USD — plafond open weight, pas champion prix-performance.
  5. Sous-estimer l'auto-hebergement : 2,8T / 896 experts exigent selon Moonshot un super-nœud 64 GPU minimum ; le hardware grand public est exclu.
  6. Faire tourner un gateway agent sur un portable : sessions a 1M tokens exigent une disponibilite 24h/24 ; veille, instabilite reseau et cles dispersees penaliseront la production.

Chronologie et donnees cles : 11 jours entre l'API et les poids complets

  • 16 juillet 2026 : lancement API K3 sur kimi.com, Kimi Code et API Moonshot — poids encore fermes.
  • 22–23 juillet : accusations americaines de « distillation industrielle » ; contexte geopolitique autour du WAIC 2026.
  • 27 juillet 2026, 23h : poids complets, rapport technique ; MoonEP et AgentEnv ouverts ; FlashKDA deja publie.
  • 28 juillet 2026 : reactions medias et institutionnelles ; trending Hugging Face #1 en 30 minutes (~1,56 To).
CaracteristiqueValeur
Parametres totaux2,8T
Parametres actives~104B par token
ArchitectureMoE — 896 experts routables, 16 actifs (+ experts partages)
AttentionKimi Delta Attention (KDA) + Gated MLA
Contexte1M tokens
Format des poidsMXFP4 poids + MXFP8 activations
Taille du telechargement~1,56 To (Hugging Face)
LicenceLicence open weight personnalisee (plus de Modified MIT comme K2)

Architecture et infrastructure : KDA, AttnRes, MoonEP

K3 repense trois piliers classiques : l'oubli scalaire du DeltaNet devient une KDA canal par canal (recurrence DPLR, temps lineaire, cache KV reduit). Les Attention Residuals (AttnRes) agregerent selectivement les sorties des couches precedentes — ~25 % d'efficacite d'entrainement pour moins de 2 % de surcout. Per-Head Muon optimise chaque tete d'attention separement (technique d'entrainement, invisible via API).

ComposantRoleIndicateur cle
KDA (FlashKDA)Backend attention lineaire sur CUTLASSPrefill sur H20 : 1,72–2,22x vs baseline
MoonEPCommunication MoE fine all-to-allQuantile Balancing ; borne theorique experts redondants
AgentEnvSandbox microVM Firecracker (KVCache.ai)Checkpoint 133 ms, restauration 49 ms (donnees editeur)
Stable LatentMoERoutage 896-of-16Sparsite ~1,8 % ; experts partages pour stabilite

Comparaison des benchmarks et seuils de licence

Priorite aux reproductions independantes (Vals AI, Artificial Analysis). Chiffres editeur en reference seulement.

ModeleSWE-bench VerifiedTypeEntree / Sortie (1M)
Claude Opus 597,0 %Ferme5 / 25 USD
GPT-5.6 Sol96,2 %Ferme
Claude Fable 595,0 %Ferme
Kimi K393,4 %Open weight3 / 15 USD (cache miss)
GLM 5.2Open weight0,45 / 3,31 USD
DeepSeek V476,2 %Open weight~0,05–0,14 / ~0,24–0,28 USD

Licence — deux seuils commerciaux : (1) Model-as-a-Service au-dela de 20 M USD de revenus sur 12 mois — accord separe avec Moonshot. (2) >100 M MAU ou >20 M USD de revenus mensuels — attribution visible « Kimi K3 » dans l'interface. Pour PME et usage interne, generalement sans friction.

Tarification API et comparaison des couts

Type de tokenPrix par millionRemarque
Entree (cache hit)0,30 USDArchitecture Mooncake : >90 % de hits sur workloads code
Entree (cache miss)3,00 USDPrefill complet
Sortie (reasoning inclus)15,00 USDBoucles agent : la sortie domine

Endpoint : https://api.moonshot.ai/v1, ID modele kimi-k3, compatible SDK OpenAI. Exemple boucle agent (1M entree + 3M sortie, cache miss) : K3 ~48 USD ; DeepSeek V4 Flash ~0,90–1,50 USD ; Claude Opus 5 ~80 USD.

python
from openai import OpenAI
import os

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.ai/v1",
)

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "Ingenieur senior. Annotations de type obligatoires."},
        {"role": "user", "content": "Refactorisez ce module pour des taches style SWE-bench."},
    ],
    max_tokens=4096,
)
print(resp.choices[0].message.content)
warning

Note production : l'auto-hebergement sous 64 GPU n'est pas prevu par Moonshot. Documentez le chemin API dans votre analyse d'impact si des donnees personnelles transitent par le modele.

Runbook en six etapes et exploitation en production

  1. Verifier licence et cas d'usage : revenus MaaS, MAU et revenus mensuels vs seuils 20 M USD ; impliquer le juridique si vous concurrencez l'API Moonshot.
  2. Choisir le mode d'acces : API officielle (avantage cache), OpenRouter avec chaine de fallback — voir le guide API OpenRouter.
  3. Routage par type de tache : volume/code → DeepSeek V4 Flash ; agent/programmation → K3 max ; critique → Claude Opus 5 — cf. matrice de juillet.
  4. Benchmarker vos propres workloads : sous-ensemble SWE interne ou taches de code ; comparer courbe de cout K3 vs GLM 5.2.
  5. Deployer le gateway agent : OpenClaw / Hermes / Kilo Code sur hote dedie ; cles API par environnement ; fallback 429/timeout.
  6. Monitoring 24h/24 : budget journalier, taux de cache hit ; hebergement : tarifs MACCOME.

Trois chiffres pour la revue technique

  • Premier modele 3T entierement ouvert : 2,8T, 1,56 To, trending Hugging Face #1 en 30 minutes.
  • 93,4 % SWE-bench (Vals AI) : +17,2 points vs DeepSeek V4 (76,2 %) ; -3,6 points vs Opus 5 (97 %).
  • Prix effectif API : avec >90 % de cache hit, entree souvent proche de 0,30 USD — la sortie a 15 USD reste le levier de cout agent.

Pour la majorite des equipes, l'auto-hebergement reste irrealiste ; un stack agent en production exige neanmoins un nœud always-on. MACCOME Mac cloud offre un macOS natif, SSH et isolation d'environnement pour un routage K3 stable — tarifs et configuration.

Sources : blog Moonshot AI, Hugging Face (moonshotai), GitHub FlashKDA, Vals AI SWE-bench, Artificial Analysis. Au 28 juillet 2026.

FAQ

Kimi K3 est-il open source ?

Non au sens OSI. C'est un modele open weight : poids, rapport technique et partie de l'infra sont publics ; donnees et code d'entrainement complets, non.

Quels seuils de licence a 20 M USD ?

Revenus MaaS >20 M USD sur 12 mois : accord separe Moonshot. >100 M MAU ou >20 M USD de revenus mensuels : attribution « Kimi K3 » dans l'UI produit.

Combien de GPU pour l'auto-hebergement ?

Moonshot recommande un super-nœud 64 GPU minimum. Voir la analyse du 16 juillet.

Que signifie SWE-bench 93,4 % ?

Reproduction independante Vals AI sur SWE-bench Verified — meilleur open weight, sous les modeles frontier fermes. Contexte : debats sur la distillation.

K3 vs Kimi K2 : differences majeures ?

K3 ~3x l'echelle de K2.5, AttnRes et Per-Head Muon ajoutes, contexte 1M ; licence avec seuils MaaS absents sur K2.

Comment deployer des agents K3 24h/24 ?

Gateway sur Mac cloud dedie ; voir tarifs location Mac mini MACCOME pour nœuds M4/M4 Pro.