Kimi K3 全面開源:2.8萬億參數、百萬上下文,月之暗面這次放了什麼大招

約 22 分鐘閱讀 · MACCOME · 最後更新:2026 年 7 月 28 日

適用讀者:關注國產大模型開源動態的技術負責人、AI 開發者與法務合規團隊。7 月 27 日晚 23 點,月之暗面正式發布 Kimi K3 完整模型權重與技術報告,同步開源 MoonEP、FlashKDA、AgentEnv 三項核心基礎設施——這是全球首個被完整開放的 3 萬億參數級別模型(2.8T 總參數,約 1040 億啟用,100 萬 token 上下文)。你將獲得:11 天首發到全面開源時間線、架構創新拆解(KDA / AttnRes / Per-Head Muon)、獨立第三方基準對比、許可證兩道商業門檻解讀、API 定價與自部署硬體門檻、六步落地 Runbook。結構:痛點 → 參數與架構 → Infra 開源 → 跑分與許可 → 部署選型 → FAQ → 收束轉化。與7/16 K3 首發評測蒸餾門爭議7 月 OpenRouter 排行互補。

bolt

TL;DR — 30 秒結論

  • 不是 OSI 意義上的「開源」:月之暗面官方始終使用 open weight(開放權重)表述,訓練資料與完整訓練程式碼未公開。
  • 規格天花板:2.8T 總參數、896 選 16 MoE、1M 上下文、1.56TB 權重體積,Hugging Face 上線半小時登頂趨勢榜第一。
  • 能力定位:Artificial Analysis 智能指數全球第 3、開源模型第 1(約 57 分),但每任務成本約 $0.95,高於 GLM-5.2(約 $0.47)——能力天花板,非性價比最優。
  • 許可證新增兩道門檻:Model-as-a-Service 年收入超 $2000 萬需另行簽約;月活超 1 億或月收入超 $2000 萬須顯著展示「Kimi K3」字樣。
  • 自部署現實:官方建議 64 卡及以上超節點;個人與中小團隊更現實的路徑是官方 API 或 OpenRouter(已有 7 家服務商)。

六大痛點:K3 權重開源後,最容易踩的六個坑

  1. 把「開放權重」當成「開源」:媒體普遍翻譯為「開源」,但月之暗面官方材料從未使用 open source——只公開了訓練完成後的權重、技術報告與推理 Infra,訓練資料與完整訓練程式碼未公開,不符合 OSI 標準。
  2. 忽視許可證新增的商業門檻:K3 不再自稱 Modified MIT,而是完全自訂許可證,新增 Model-as-a-Service 收入門檻與規模展示門檻——若你的商業模式是與月之暗面競爭的模型 API 服務,第一道門檻是法務紅線。
  3. 誤讀基準測試數字:廠商自報與獨立第三方複測差異大;SWE-bench Verified 獨立複測 K3 為 93.4%,低於 Claude Opus 5(97%)與 GPT-5.6 Sol(96.2%),但在開源陣營中仍屬頂尖。
  4. 只看能力不看成本:K3 每任務約 $0.95,比 Claude Fable 5(約 $2.4)便宜 60%,但比同為開源的 GLM-5.2(約 $0.47)貴一倍——它是開源陣營能力天花板,不是性價比最優選。
  5. 低估自部署硬體門檻:2.8T 參數、896 個專家的規模決定了 K3 幾乎不可能在消費級硬體執行;官方建議 64 卡及以上超節點,個人開發者應走 API 或 OpenRouter。
  6. 在筆電上跑 Agent 長會話對接 K3:百萬上下文程式設計 Agent 需要 7×24 線上 Gateway;合蓋睡眠、網路抖動與 API Key 散落是三大隱性成本,與模型能力無關但直接影響生產穩定性。

時間線:從 API 首發到全面開源,只用了 11 天

  • 7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 Kimi API 首發,僅限線上呼叫,權重尚未公開。官方技術部落格標題為《Kimi K3: Open Frontier Intelligence》。
  • 7 月 17 日:業界開始密集分析其架構,新華社報導稱其為「目前全球參數最大的開源模型」。
  • 7 月 22–23 日:中美「模型蒸餾」爭端升級。美國白宮科技顧問 Michael Kratsios 指控月之暗面對 Anthropic 的 Fable 模型進行「大規模、隱蔽的工業化蒸餾」;美國財政部長 Scott Bessent 隨後表示將考慮對相關中國企業實施制裁及「實體清單」限制。
  • 7 月 27 日晚 23 點:月之暗面正式發布 K3 完整模型權重、技術報告,並開源 MoonEP、AgentEnv(FlashKDA 此前已開源)。
  • 7 月 28 日:中國商務部就中美 AI 爭端公開回應,指責美方搞「AI 霸權主義」並威脅採取反制措施;國內多家媒體跟進報導本次開源細節。

這次開源距離 Kimi K3 在 kimi.com 和 API 端首發,只過去了 11 天。權重檔案在 Hugging Face 上體積約 1.56TB,上線半小時內即登頂趨勢榜第一。

Kimi K3 核心參數一覽

項目參數
總參數量2.8 萬億(2.8T)
啟用參數量1040 億
架構類型混合專家模型(MoE)
專家配置896 個路由專家,每 token 啟用 16 個(另有共享專家)
注意力機制Kimi Delta Attention(KDA)+ 門控多頭潛在注意力(Gated MLA)
上下文視窗100 萬 token
多模態能力原生視覺理解(ViT-V2,27 層)
權重格式MXFP4 權重 + MXFP8 啟用(SFT 階段起量化感知訓練)
權重體積約 1.56TB(Hugging Face)
License自訂許可證(官方稱 open weight,非 open source)

三大架構創新:KDA、AttnRes 和 Per-Head Muon 分別解決了什麼問題

Kimi K3 在架構上重構了深度學習沿用多年的三大傳統元件——注意力機制、殘差連接、最佳化器,這也是它區別於「簡單堆參數」的關鍵。

Kimi Delta Attention(KDA):讓「遺忘」變得更精細

傳統的 Gated DeltaNet 使用純量級的遺忘門——整個記憶用同一個衰減係數處理。KDA 把這個門控改成了逐通道級別:每一個特徵維度都擁有自己獨立的衰減率,模型因此可以讓某些特徵長期保留、另一些特徵快速遺忘。KDA 採用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式實現線性時間遞迴,在保證硬體效率的同時大幅降低了長序列處理的 GPU 記憶體開銷。K3 將 KDA 與少量全域注意力層(Gated MLA)交替混合使用,這也是它能支撐 100 萬 token 上下文、同時把 KV Cache 開銷壓到極低的核心原因。

Attention Residuals(AttnRes):殘差連接不再是「雨露均霑」

傳統殘差連接會把每一層的輸出逐層均勻累加傳遞下去,層數越深,早期層的資訊越容易被「稀釋」。AttnRes 把這個過程改成了「選擇性、依據輸入動態聚合前面所有層的輸出」——每一層只需新增一個 RMSNorm 和一個偽查詢向量,參數開銷幾乎可以忽略不計,卻能帶來約 25% 的訓練效率提升,代價不到 2%。

Per-Head Muon:讓每個注意力頭獨立學習

K3 在 Muon 最佳化器基礎上做了「逐注意力頭獨立最佳化」的擴展,讓每個注意力頭擁有更自適應的收斂路徑。這是一項純訓練期技術,一般開發者呼叫 API 時無感知,但正是這類細節的堆疊,讓 K3 能以相對更少的啟用參數打出接近頂尖閉源模型的效果。

Stable LatentMoE:896 選 16 的稀疏藝術

K3 的 MoE 層擁有 896 個路由專家,每個 token 只啟用 16 個(稀疏度約 1.8%),配合共享專家保證基礎能力的穩定性。團隊採用了 Quantile Balancing 均衡策略,並配合 MoonEP,從數學上證明了每個運算節點冗餘專家數的理論上界。

三大開源 Infra 技術:不只是甩權重,而是整套工程能力

技術定位關鍵能力
MoonEP超大規模細粒度 MoE 高效能通訊函式庫透過暫時複製過載專家保證每個運算節點獲得均等 token 數;證明冗餘專家數理論上界,負載不均衡時仍維持高通訊效率
FlashKDA基於 NVIDIA CUTLASS 的 KDA 高效能算子(此前已開源)在 NVIDIA H20 上 prefill 速度提升 1.72–2.22 倍;可作為 flash-linear-attention 函式庫中 chunk_kda 的直接替代後端
AgentEnv與 KVCache.ai 聯合開發的 Agent 沙箱(Firecracker microVM)面向大規模並行 Agent RL 訓練;官方披露 checkpoint 延遲低至 133ms、恢復延遲 49ms、記憶體超分最高 6.5 倍(尚未經第三方獨立複現)

跑分對比:和 GPT-5.6、Claude、GLM-4.5 比一比

不同機構、不同評測框架給出的數字差異較大,以下優先引用獨立第三方複測資料。

模型SWE-bench Verified發布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 智能指數(max 推理檔):Claude Fable 5(max + fallback)60 分;GPT-5.6 Sol(max)59 分;Kimi K3(max)約 57 分,全球第 3,開源模型第 1;GLM-5.2(max)51 分(此前的開源第一名);DeepSeek V4 Pro(max)44 分。

簡單來說:它是開源陣營裡能力天花板最高的選項,而不是性價比最高的選項。Kimi K3 目前在 Arena.ai 的 Frontend Code Arena 榜單上排名第一。

是「開源」還是「開放權重」?許可證裡的兩道商業門檻

月之暗面官方材料從未使用「open source」,一直採用「open weight(開放權重)」的表述。許可證包含兩道此前 K2 系列都沒有的商業門檻:

  1. Model-as-a-Service 收入門檻:如果被許可方營運「模型即服務」業務,且連續 12 個月內該業務累計收入超過 2000 萬美元,必須與月之暗面另行簽署商業協議。
  2. 規模展示門檻:如果產品月活使用者超過 1 億,或月收入超過 2000 萬美元,必須在產品介面上顯著展示「Kimi K3」字樣。

對絕大多數中小團隊和新創公司而言,這兩道門檻幾乎不會被觸發,可以正常商用。

API 定價與自部署:能不能自己跑起來?

Token 類型價格(每百萬 token)
輸入(快取命中)$0.30
輸入(快取未命中)$3.00
輸出(含推理過程)$15.00

月之暗面提供 OpenAI SDK 相容的 Chat Completions API(https://api.moonshot.ai/v1,模型 ID kimi-k3)。由於 Mooncake 分離式推理架構在典型程式設計類工作負載上快取命中率可達 90% 以上,實際大部分呼叫成本會更接近 $0.30 這一檔。

自部署方面:官方建議部署在 64 卡及以上的超節點配置上。對於個人開發者和大部分中小團隊,更現實的路徑是透過 OpenRouter 等第三方平台呼叫已託管的 K3(目前已有 7 家服務商上線)。

python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "You are a senior software engineer."},
        {"role": "user", "content": "Refactor this function with type hints and docstrings."},
    ],
    max_tokens=4096,
)
print(response.choices[0].message.content)

六步 Runbook:K3 權重開源後的落地路徑

  1. 釐清使用場景與合規邊界:閱讀自訂許可證全文,確認你的業務是否觸及 Model-as-a-Service 收入門檻($2000 萬/12 個月)或規模展示門檻(1 億 MAU / $2000 萬月收入)。若僅內部使用或中小規模商用,通常無額外限制。
  2. 選擇接入路徑:評估官方 API(Mooncake 快取命中率高)、OpenRouter 多 provider 路由、或自部署(需 64 卡超節點)。參考OpenRouter API 整合指南配置 fallback 鏈。
  3. 按任務分層路由:簡單對話走 Flash 檔中國模型,複雜程式設計與 Agent 任務走 K3 max 推理檔,極限困難任務保留 Claude Opus 5 / GPT-5.6 Sol——參考7 月 OpenRouter 分層路由範例
  4. 驗證基準與成本:在你的真實工作負載上跑 SWE-bench 子集或內部評測集,對比 K3(約 $0.95/任務)與 GLM-5.2(約 $0.47/任務)的性價比曲線,避免「能力過剩」燒錢。
  5. 部署 Agent Gateway:在專用節點執行 OpenClaw / Hermes Agent / Kilo Code,將 K3 設為程式設計任務主模型,配置 429/逾時自動降級;API Key 分環境管理,禁止硬編碼進程式碼儲存庫。
  6. 建立 7×24 監控與成本告警:設日預算上限與快取命中率監控;長會話 Agent 任務部署在專用 Mac 雲主機,避免筆電睡眠中斷推理鏈路。

三條應寫進技術評審的硬核數據

  • 全球首個完整開放的 3T 級模型:2.8T 總參數、1.56TB 權重體積,Hugging Face 上線 30 分鐘內登頂趨勢榜第一——此前沒有任何 3 萬億參數級別模型被完整開放過。
  • 獨立第三方 SWE-bench Verified:K3 得分 93.4%(Vals AI 複測),距 Claude Opus 5(97%)差 3.6 個百分點,但領先 DeepSeek-V4(76.2%)17.2 個百分點
  • FlashKDA 硬體加速:在 NVIDIA H20 上相比 flash-linear-attention 基線,prefill 速度提升 1.72–2.22 倍——長上下文場景的實際推理成本可能被顯著拉低。

開源背後的地緣背景:WAIC 2026 與中美 AI 爭端

Kimi K3 的開源節點卡在世界人工智慧大會(WAIC 2026)窗口期,同時疊加了正在升級的中美「模型蒸餾」爭端——就在權重開源前幾天,美方指控月之暗面「工業化蒸餾」Anthropic 的模型來訓練 K3,並威脅制裁;中國商務部則在 7 月 28 日公開回應,指責美方搞「AI 霸權主義」。在這樣的背景下,月之暗面選擇把權重、技術報告和三項核心 Infra 技術全部公開,某種程度上也是一種態度表達:用完整的工程細節自證技術路徑的獨立性。三天後,阿里巴巴發布了 24 萬億參數的 Qwen3.8-Max-Preview,被外界普遍解讀為對 K3 的直接回應,國產大模型的競爭正式進入「3T 俱樂部」階段。

自部署不現實時:為什麼 Agent 棧仍需要專用節點

對絕大多數團隊而言,K3 自部署的 64 卡門檻意味著API 呼叫是唯一現實路徑。但即便走 API,生產級 Agent 工作流(OpenClaw、Hermes Agent、Kilo Code 對接 K3)仍面臨三大隱性成本:筆電合蓋睡眠中斷長會話、網路抖動導致推理鏈路斷裂、API Key 散落在多台開發機無法統一輪換。這些與 K3 模型能力無關,卻直接決定你能否把 93.4% 的 SWE-bench 能力穩定轉化為業務產出。

若在本地筆電上切換多模型 Gateway,上述問題會隨上下文視窗拉長(K3 支援 100 萬 token)而放大。對於更穩定、更適合 AI Agent 自動化的生產環境,MACCOME 的 Mac 雲主機通常是更優解——真實 macOS、SSH 交接、環境隔離,讓 K3 API 路由與 Agent Gateway 在專用執行個體上 7×24 穩定執行。方案與定價見Mac mini 雲租用價格

資料來源:Moonshot AI 官方部落格(kimi.com/blog/kimi-k3)、Hugging Face(moonshotai org)、GitHub(moonshotai/FlashKDA)、Vals AI SWE-bench Verified 排行榜、Artificial Analysis Intelligence Index、VentureBeat、Simon Willison's blog。發布前請以官方最新資料為準。

常見問題

Kimi K3 真的是開源模型嗎?

嚴格來說不是。它屬於「開放權重(open weight)」模型:訓練完成的權重檔案、技術報告和部分 Infra 工具是公開的,但訓練資料和完整訓練程式碼沒有公開,不符合 OSI 標準下的「開源」定義。月之暗面官方始終使用 open weight,從未使用 open source。

Kimi K3 可以免費商用嗎?

可以,絕大多數商業場景不受限制。但如果你營運的是「模型即服務」業務且年收入超過 2000 萬美元,或產品月活超過 1 億/月收入超過 2000 萬美元,需要額外滿足許可證中的特定條款。

Kimi K3 需要多少加速卡才能自己部署?

官方建議部署在 64 卡及以上的超節點叢集,個人和大部分企業使用者更現實的方式是透過官方 API 或 OpenRouter 等第三方平台呼叫。詳見7/16 K3 首發評測中的接入方式對比。

Kimi K3 的效能到底強不強?

在開源模型陣營中綜合能力最強,Artificial Analysis 智能指數全球第 3,僅次於 Claude Fable 5 和 GPT-5.6 Sol;但成本高於同為開源的 GLM-5.2,屬於「開源陣營天花板最高、但非性價比最優」的選擇。蒸餾爭議背景見Opus 5 與 K3 蒸餾門

Kimi K3 和 Kimi K2 有什麼區別?

K3 參數規模是 K2.5 的約 3 倍,架構上新增了 Attention Residuals 和 Per-Head Muon,上下文視窗和多模態能力也大幅提升;許可證方面 K3 新增了 Model-as-a-Service 收入門檻,商業限制比 K2 系列更細化。

如何在生產環境 7×24 執行對接 K3 的 Agent 棧?

推薦在專用 Mac 雲主機部署 OpenClaw / Hermes Agent 等 Gateway,配合 K3 API 或 OpenRouter 分層路由;避免筆電睡眠中斷長會話。查看MACCOME Mac 雲租用方案取得節點配置與定價。