Public cible : responsables techniques, developpeurs et equipes juridiques qui evaluent les releases open weight avec rigueur. Fait marquant (27 juillet 2026, 23h Pekin) : Moonshot AI publie Kimi K3 en open weight — 2,8T parametres totaux, ~104B actives, 1M tokens de contexte, ~1,56 To sur Hugging Face. Ce que vous obtenez : chronologie API→poids en 11 jours, tableaux architecture KDA/MoE et infra, benchmarks independants, seuils de licence a 20 M USD, tarification API 0,30 / 3 / 15 USD, seuil super-nœud 64 GPU et runbook en six etapes. Suite de notre premiere analyse du 16 juillet, de la controverse sur la distillation et du classement OpenRouter de juillet.
Synthese — 30 secondes
| Caracteristique | Valeur |
|---|---|
| Parametres totaux | 2,8T |
| Parametres actives | ~104B par token |
| Architecture | MoE — 896 experts routables, 16 actifs (+ experts partages) |
| Attention | Kimi Delta Attention (KDA) + Gated MLA |
| Contexte | 1M tokens |
| Format des poids | MXFP4 poids + MXFP8 activations |
| Taille du telechargement | ~1,56 To (Hugging Face) |
| Licence | Licence open weight personnalisee (plus de Modified MIT comme K2) |
K3 repense trois piliers classiques : l'oubli scalaire du DeltaNet devient une KDA canal par canal (recurrence DPLR, temps lineaire, cache KV reduit). Les Attention Residuals (AttnRes) agregerent selectivement les sorties des couches precedentes — ~25 % d'efficacite d'entrainement pour moins de 2 % de surcout. Per-Head Muon optimise chaque tete d'attention separement (technique d'entrainement, invisible via API).
| Composant | Role | Indicateur cle |
|---|---|---|
| KDA (FlashKDA) | Backend attention lineaire sur CUTLASS | Prefill sur H20 : 1,72–2,22x vs baseline |
| MoonEP | Communication MoE fine all-to-all | Quantile Balancing ; borne theorique experts redondants |
| AgentEnv | Sandbox microVM Firecracker (KVCache.ai) | Checkpoint 133 ms, restauration 49 ms (donnees editeur) |
| Stable LatentMoE | Routage 896-of-16 | Sparsite ~1,8 % ; experts partages pour stabilite |
Priorite aux reproductions independantes (Vals AI, Artificial Analysis). Chiffres editeur en reference seulement.
| Modele | SWE-bench Verified | Type | Entree / Sortie (1M) |
|---|---|---|---|
| Claude Opus 5 | 97,0 % | Ferme | 5 / 25 USD |
| GPT-5.6 Sol | 96,2 % | Ferme | — |
| Claude Fable 5 | 95,0 % | Ferme | — |
| Kimi K3 | 93,4 % | Open weight | 3 / 15 USD (cache miss) |
| GLM 5.2 | — | Open weight | 0,45 / 3,31 USD |
| DeepSeek V4 | 76,2 % | Open weight | ~0,05–0,14 / ~0,24–0,28 USD |
Licence — deux seuils commerciaux : (1) Model-as-a-Service au-dela de 20 M USD de revenus sur 12 mois — accord separe avec Moonshot. (2) >100 M MAU ou >20 M USD de revenus mensuels — attribution visible « Kimi K3 » dans l'interface. Pour PME et usage interne, generalement sans friction.
| Type de token | Prix par million | Remarque |
|---|---|---|
| Entree (cache hit) | 0,30 USD | Architecture Mooncake : >90 % de hits sur workloads code |
| Entree (cache miss) | 3,00 USD | Prefill complet |
| Sortie (reasoning inclus) | 15,00 USD | Boucles agent : la sortie domine |
Endpoint : https://api.moonshot.ai/v1, ID modele kimi-k3, compatible SDK OpenAI. Exemple boucle agent (1M entree + 3M sortie, cache miss) : K3 ~48 USD ; DeepSeek V4 Flash ~0,90–1,50 USD ; Claude Opus 5 ~80 USD.
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
resp = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": "Ingenieur senior. Annotations de type obligatoires."},
{"role": "user", "content": "Refactorisez ce module pour des taches style SWE-bench."},
],
max_tokens=4096,
)
print(resp.choices[0].message.content)
Note production : l'auto-hebergement sous 64 GPU n'est pas prevu par Moonshot. Documentez le chemin API dans votre analyse d'impact si des donnees personnelles transitent par le modele.
Pour la majorite des equipes, l'auto-hebergement reste irrealiste ; un stack agent en production exige neanmoins un nœud always-on. MACCOME Mac cloud offre un macOS natif, SSH et isolation d'environnement pour un routage K3 stable — tarifs et configuration.
Sources : blog Moonshot AI, Hugging Face (moonshotai), GitHub FlashKDA, Vals AI SWE-bench, Artificial Analysis. Au 28 juillet 2026.
FAQ
Kimi K3 est-il open source ?
Non au sens OSI. C'est un modele open weight : poids, rapport technique et partie de l'infra sont publics ; donnees et code d'entrainement complets, non.
Quels seuils de licence a 20 M USD ?
Revenus MaaS >20 M USD sur 12 mois : accord separe Moonshot. >100 M MAU ou >20 M USD de revenus mensuels : attribution « Kimi K3 » dans l'UI produit.
Combien de GPU pour l'auto-hebergement ?
Moonshot recommande un super-nœud 64 GPU minimum. Voir la analyse du 16 juillet.
Que signifie SWE-bench 93,4 % ?
Reproduction independante Vals AI sur SWE-bench Verified — meilleur open weight, sous les modeles frontier fermes. Contexte : debats sur la distillation.
K3 vs Kimi K2 : differences majeures ?
K3 ~3x l'echelle de K2.5, AttnRes et Per-Head Muon ajoutes, contexte 1M ; licence avec seuils MaaS absents sur K2.
Comment deployer des agents K3 24h/24 ?
Gateway sur Mac cloud dedie ; voir tarifs location Mac mini MACCOME pour nœuds M4/M4 Pro.