適用讀者:關注國產大模型開源動態的技術負責人、AI 開發者與法務合規團隊。7 月 27 日晚 23 點,月之暗面正式發布 Kimi K3 完整模型權重與技術報告,同步開源 MoonEP、FlashKDA、AgentEnv 三項核心基礎設施——這是全球首個被完整開放的 3 萬億參數級別模型(2.8T 總參數,約 1040 億啟用,100 萬 token 上下文)。你將獲得:11 天首發到全面開源時間線、架構創新拆解(KDA / AttnRes / Per-Head Muon)、獨立第三方基準對比、許可證兩道商業門檻解讀、API 定價與自部署硬體門檻、六步落地 Runbook。結構:痛點 → 參數與架構 → Infra 開源 → 跑分與許可 → 部署選型 → FAQ → 收束轉化。與7/16 K3 首發評測、蒸餾門爭議、7 月 OpenRouter 排行互補。
TL;DR — 30 秒結論
這次開源距離 Kimi K3 在 kimi.com 和 API 端首發,只過去了 11 天。權重檔案在 Hugging Face 上體積約 1.56TB,上線半小時內即登頂趨勢榜第一。
| 項目 | 參數 |
|---|---|
| 總參數量 | 2.8 萬億(2.8T) |
| 啟用參數量 | 約 1040 億 |
| 架構類型 | 混合專家模型(MoE) |
| 專家配置 | 896 個路由專家,每 token 啟用 16 個(另有共享專家) |
| 注意力機制 | Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA) |
| 上下文視窗 | 100 萬 token |
| 多模態能力 | 原生視覺理解(ViT-V2,27 層) |
| 權重格式 | MXFP4 權重 + MXFP8 啟用(SFT 階段起量化感知訓練) |
| 權重體積 | 約 1.56TB(Hugging Face) |
| License | 自訂許可證(官方稱 open weight,非 open source) |
Kimi K3 在架構上重構了深度學習沿用多年的三大傳統元件——注意力機制、殘差連接、最佳化器,這也是它區別於「簡單堆參數」的關鍵。
傳統的 Gated DeltaNet 使用純量級的遺忘門——整個記憶用同一個衰減係數處理。KDA 把這個門控改成了逐通道級別:每一個特徵維度都擁有自己獨立的衰減率,模型因此可以讓某些特徵長期保留、另一些特徵快速遺忘。KDA 採用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式實現線性時間遞迴,在保證硬體效率的同時大幅降低了長序列處理的 GPU 記憶體開銷。K3 將 KDA 與少量全域注意力層(Gated MLA)交替混合使用,這也是它能支撐 100 萬 token 上下文、同時把 KV Cache 開銷壓到極低的核心原因。
傳統殘差連接會把每一層的輸出逐層均勻累加傳遞下去,層數越深,早期層的資訊越容易被「稀釋」。AttnRes 把這個過程改成了「選擇性、依據輸入動態聚合前面所有層的輸出」——每一層只需新增一個 RMSNorm 和一個偽查詢向量,參數開銷幾乎可以忽略不計,卻能帶來約 25% 的訓練效率提升,代價不到 2%。
K3 在 Muon 最佳化器基礎上做了「逐注意力頭獨立最佳化」的擴展,讓每個注意力頭擁有更自適應的收斂路徑。這是一項純訓練期技術,一般開發者呼叫 API 時無感知,但正是這類細節的堆疊,讓 K3 能以相對更少的啟用參數打出接近頂尖閉源模型的效果。
K3 的 MoE 層擁有 896 個路由專家,每個 token 只啟用 16 個(稀疏度約 1.8%),配合共享專家保證基礎能力的穩定性。團隊採用了 Quantile Balancing 均衡策略,並配合 MoonEP,從數學上證明了每個運算節點冗餘專家數的理論上界。
| 技術 | 定位 | 關鍵能力 |
|---|---|---|
| MoonEP | 超大規模細粒度 MoE 高效能通訊函式庫 | 透過暫時複製過載專家保證每個運算節點獲得均等 token 數;證明冗餘專家數理論上界,負載不均衡時仍維持高通訊效率 |
| FlashKDA | 基於 NVIDIA CUTLASS 的 KDA 高效能算子(此前已開源) | 在 NVIDIA H20 上 prefill 速度提升 1.72–2.22 倍;可作為 flash-linear-attention 函式庫中 chunk_kda 的直接替代後端 |
| AgentEnv | 與 KVCache.ai 聯合開發的 Agent 沙箱(Firecracker microVM) | 面向大規模並行 Agent RL 訓練;官方披露 checkpoint 延遲低至 133ms、恢復延遲 49ms、記憶體超分最高 6.5 倍(尚未經第三方獨立複現) |
不同機構、不同評測框架給出的數字差異較大,以下優先引用獨立第三方複測資料。
| 模型 | SWE-bench Verified | 發布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指數(max 推理檔):Claude Fable 5(max + fallback)60 分;GPT-5.6 Sol(max)59 分;Kimi K3(max)約 57 分,全球第 3,開源模型第 1;GLM-5.2(max)51 分(此前的開源第一名);DeepSeek V4 Pro(max)44 分。
簡單來說:它是開源陣營裡能力天花板最高的選項,而不是性價比最高的選項。Kimi K3 目前在 Arena.ai 的 Frontend Code Arena 榜單上排名第一。
月之暗面官方材料從未使用「open source」,一直採用「open weight(開放權重)」的表述。許可證包含兩道此前 K2 系列都沒有的商業門檻:
對絕大多數中小團隊和新創公司而言,這兩道門檻幾乎不會被觸發,可以正常商用。
| Token 類型 | 價格(每百萬 token) |
|---|---|
| 輸入(快取命中) | $0.30 |
| 輸入(快取未命中) | $3.00 |
| 輸出(含推理過程) | $15.00 |
月之暗面提供 OpenAI SDK 相容的 Chat Completions API(https://api.moonshot.ai/v1,模型 ID kimi-k3)。由於 Mooncake 分離式推理架構在典型程式設計類工作負載上快取命中率可達 90% 以上,實際大部分呼叫成本會更接近 $0.30 這一檔。
自部署方面:官方建議部署在 64 卡及以上的超節點配置上。對於個人開發者和大部分中小團隊,更現實的路徑是透過 OpenRouter 等第三方平台呼叫已託管的 K3(目前已有 7 家服務商上線)。
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": "You are a senior software engineer."},
{"role": "user", "content": "Refactor this function with type hints and docstrings."},
],
max_tokens=4096,
)
print(response.choices[0].message.content)
Kimi K3 的開源節點卡在世界人工智慧大會(WAIC 2026)窗口期,同時疊加了正在升級的中美「模型蒸餾」爭端——就在權重開源前幾天,美方指控月之暗面「工業化蒸餾」Anthropic 的模型來訓練 K3,並威脅制裁;中國商務部則在 7 月 28 日公開回應,指責美方搞「AI 霸權主義」。在這樣的背景下,月之暗面選擇把權重、技術報告和三項核心 Infra 技術全部公開,某種程度上也是一種態度表達:用完整的工程細節自證技術路徑的獨立性。三天後,阿里巴巴發布了 24 萬億參數的 Qwen3.8-Max-Preview,被外界普遍解讀為對 K3 的直接回應,國產大模型的競爭正式進入「3T 俱樂部」階段。
對絕大多數團隊而言,K3 自部署的 64 卡門檻意味著API 呼叫是唯一現實路徑。但即便走 API,生產級 Agent 工作流(OpenClaw、Hermes Agent、Kilo Code 對接 K3)仍面臨三大隱性成本:筆電合蓋睡眠中斷長會話、網路抖動導致推理鏈路斷裂、API Key 散落在多台開發機無法統一輪換。這些與 K3 模型能力無關,卻直接決定你能否把 93.4% 的 SWE-bench 能力穩定轉化為業務產出。
若在本地筆電上切換多模型 Gateway,上述問題會隨上下文視窗拉長(K3 支援 100 萬 token)而放大。對於更穩定、更適合 AI Agent 自動化的生產環境,MACCOME 的 Mac 雲主機通常是更優解——真實 macOS、SSH 交接、環境隔離,讓 K3 API 路由與 Agent Gateway 在專用執行個體上 7×24 穩定執行。方案與定價見Mac mini 雲租用價格。
資料來源:Moonshot AI 官方部落格(kimi.com/blog/kimi-k3)、Hugging Face(moonshotai org)、GitHub(moonshotai/FlashKDA)、Vals AI SWE-bench Verified 排行榜、Artificial Analysis Intelligence Index、VentureBeat、Simon Willison's blog。發布前請以官方最新資料為準。
常見問題
Kimi K3 真的是開源模型嗎?
嚴格來說不是。它屬於「開放權重(open weight)」模型:訓練完成的權重檔案、技術報告和部分 Infra 工具是公開的,但訓練資料和完整訓練程式碼沒有公開,不符合 OSI 標準下的「開源」定義。月之暗面官方始終使用 open weight,從未使用 open source。
Kimi K3 可以免費商用嗎?
可以,絕大多數商業場景不受限制。但如果你營運的是「模型即服務」業務且年收入超過 2000 萬美元,或產品月活超過 1 億/月收入超過 2000 萬美元,需要額外滿足許可證中的特定條款。
Kimi K3 需要多少加速卡才能自己部署?
官方建議部署在 64 卡及以上的超節點叢集,個人和大部分企業使用者更現實的方式是透過官方 API 或 OpenRouter 等第三方平台呼叫。詳見7/16 K3 首發評測中的接入方式對比。
Kimi K3 的效能到底強不強?
在開源模型陣營中綜合能力最強,Artificial Analysis 智能指數全球第 3,僅次於 Claude Fable 5 和 GPT-5.6 Sol;但成本高於同為開源的 GLM-5.2,屬於「開源陣營天花板最高、但非性價比最優」的選擇。蒸餾爭議背景見Opus 5 與 K3 蒸餾門。
Kimi K3 和 Kimi K2 有什麼區別?
K3 參數規模是 K2.5 的約 3 倍,架構上新增了 Attention Residuals 和 Per-Head Muon,上下文視窗和多模態能力也大幅提升;許可證方面 K3 新增了 Model-as-a-Service 收入門檻,商業限制比 K2 系列更細化。
如何在生產環境 7×24 執行對接 K3 的 Agent 棧?
推薦在專用 Mac 雲主機部署 OpenClaw / Hermes Agent 等 Gateway,配合 K3 API 或 OpenRouter 分層路由;避免筆電睡眠中斷長會話。查看MACCOME Mac 雲租用方案取得節點配置與定價。