Kimi K3 全面开源:2.8万亿参数、百万上下文,月之暗面这次放了什么大招

约 22 分钟阅读 · MACCOME · 最后更新:2026 年 7 月 28 日

适用读者:关注国产大模型开源动态的技术负责人、AI 开发者与法务合规团队。📦 7 月 27 日晚 23 点,月之暗面正式发布 Kimi K3 完整模型权重与技术报告,同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施——这是全球首个被完整开放的 3 万亿参数级别模型(2.8T 总参数,约 1040 亿激活,100 万 token 上下文)。你将获得:11 天首发到全面开源时间线、架构创新拆解(KDA / AttnRes / Per-Head Muon)、独立第三方基准对比、许可证两道商业门槛解读、API 定价与自部署硬件门槛、六步落地 Runbook。结构:痛点 → 参数与架构 → Infra 开源 → 跑分与许可 → 部署选型 → FAQ → 收束转化。与7/16 K3 首发评测蒸馏门争议7 月 OpenRouter 排行互补。

bolt

TL;DR — 30 秒结论

  • 不是 OSI 意义上的「开源」:月之暗面官方始终使用 open weight(开放权重)表述,训练数据与完整训练代码未公开。
  • 规格天花板:2.8T 总参数、896 选 16 MoE、1M 上下文、1.56TB 权重体积,Hugging Face 上线半小时登顶趋势榜第一。
  • 能力定位:Artificial Analysis 智能指数全球第 3、开源模型第 1(约 57 分),但每任务成本约 $0.95,高于 GLM-5.2(约 $0.47)——能力天花板,非性价比最优。
  • 许可证新增两道门槛:Model-as-a-Service 年收入超 $2000 万需另行签约;月活超 1 亿或月收入超 $2000 万须显著展示「Kimi K3」字样。
  • 自部署现实:官方建议 64 卡及以上超节点;个人与中小团队更现实的路径是官方 API 或 OpenRouter(已有 7 家服务商)。

六大痛点:K3 权重开源后,最容易踩的六个坑

  1. 把「开放权重」当成「开源」:媒体普遍翻译为「开源」,但月之暗面官方材料从未使用 open source——只公开了训练完成后的权重、技术报告与推理 Infra,训练数据与完整训练代码未公开,不符合 OSI 标准。
  2. 忽视许可证新增的商业门槛:K3 不再自称 Modified MIT,而是完全自定义许可证,新增 Model-as-a-Service 收入门槛与规模展示门槛——若你的商业模式是与月之暗面竞争的模型 API 服务,第一道门槛是法务红线。
  3. 误读基准测试数字:厂商自报与独立第三方复测差异大;SWE-bench Verified 独立复测 K3 为 93.4%,低于 Claude Opus 5(97%)与 GPT-5.6 Sol(96.2%),但在开源阵营中仍属顶尖。
  4. 只看能力不看成本:K3 每任务约 $0.95,比 Claude Fable 5(约 $2.4)便宜 60%,但比同为开源的 GLM-5.2(约 $0.47)贵一倍——它是开源阵营能力天花板,不是性价比最优选。
  5. 低估自部署硬件门槛:2.8T 参数、896 个专家的规模决定了 K3 几乎不可能在消费级硬件运行;官方建议 64 卡及以上超节点,个人开发者应走 API 或 OpenRouter。
  6. 在笔记本上跑 Agent 长会话对接 K3:百万上下文编程 Agent 需要 7×24 在线 Gateway;合盖睡眠、网络抖动与 API Key 散落是三大隐性成本,与模型能力无关但直接影响生产稳定性。

时间线:从 API 首发到全面开源,只用了 11 天

  • 7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 Kimi API 首发,仅限在线调用,权重尚未公开。官方技术博客标题为《Kimi K3: Open Frontier Intelligence》。
  • 7 月 17 日:行业开始密集分析其架构,新华社报道称其为「目前全球参数最大的开源模型」。
  • 7 月 22–23 日:中美「模型蒸馏」争端升级。美国白宫科技顾问 Michael Kratsios 指控月之暗面对 Anthropic 的 Fable 模型进行「大规模、隐蔽的工业化蒸馏」;美国财政部长 Scott Bessent 随后表示将考虑对相关中国企业实施制裁及「实体清单」限制。
  • 7 月 27 日晚 23 点:月之暗面正式发布 K3 完整模型权重、技术报告,并开源 MoonEP、AgentEnv(FlashKDA 此前已开源)。
  • 7 月 28 日:中国商务部就中美 AI 争端公开回应,指责美方搞「AI 霸权主义」并威胁采取反制措施;国内多家媒体跟进报道本次开源细节。

这次开源距离 Kimi K3 在 kimi.com 和 API 端首发,只过去了 11 天。权重文件在 Hugging Face 上体积约 1.56TB,上线半小时内即登顶趋势榜第一。

Kimi K3 核心参数一览

项目参数
总参数量2.8 万亿(2.8T)
激活参数量1040 亿
架构类型混合专家模型(MoE)
专家配置896 个路由专家,每 token 激活 16 个(另有共享专家)
注意力机制Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA)
上下文窗口100 万 token
多模态能力原生视觉理解(ViT-V2,27 层)
权重格式MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练)
权重体积约 1.56TB(Hugging Face)
License自定义许可证(官方称 open weight,非 open source)

三大架构创新:KDA、AttnRes 和 Per-Head Muon 分别解决了什么问题

Kimi K3 在架构上重构了深度学习沿用多年的三大传统组件——注意力机制、残差连接、优化器,这也是它区别于「简单堆参数」的关键。

Kimi Delta Attention(KDA):让「遗忘」变得更精细

传统的 Gated DeltaNet 使用标量级的遗忘门——整个记忆用同一个衰减系数处理。KDA 把这个门控改成了逐通道级别:每一个特征维度都拥有自己独立的衰减率,模型因此可以让某些特征长期保留、另一些特征快速遗忘。KDA 采用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式实现线性时间递归,在保证硬件效率的同时大幅降低了长序列处理的显存开销。K3 将 KDA 与少量全局注意力层(Gated MLA)交替混合使用,这也是它能支撑 100 万 token 上下文、同时把 KV Cache 开销压到极低的核心原因。

Attention Residuals(AttnRes):残差连接不再是「雨露均沾」

传统残差连接会把每一层的输出逐层均匀累加传递下去,层数越深,早期层的信息越容易被「稀释」。AttnRes 把这个过程改成了「选择性、依据输入动态聚合前面所有层的输出」——每一层只需新增一个 RMSNorm 和一个伪查询向量,参数开销几乎可以忽略不计,却能带来约 25% 的训练效率提升,代价不到 2%。

Per-Head Muon:让每个注意力头独立学习

K3 在 Muon 优化器基础上做了「逐注意力头独立优化」的扩展,让每个注意力头拥有更自适应的收敛路径。这是一项纯训练期技术,普通开发者调用 API 时无感知,但正是这类细节的堆叠,让 K3 能以相对更少的激活参数打出接近顶尖闭源模型的效果。

Stable LatentMoE:896 选 16 的稀疏艺术

K3 的 MoE 层拥有 896 个路由专家,每个 token 只激活 16 个(稀疏度约 1.8%),配合共享专家保证基础能力的稳定性。团队采用了 Quantile Balancing 均衡策略,并配合 MoonEP,从数学上证明了每个计算节点冗余专家数的理论上界。

三大开源 Infra 技术:不只是甩权重,而是整套工程能力

技术定位关键能力
MoonEP超大规模细粒度 MoE 高性能通信库通过临时复制过载专家保证每个计算节点获得均等 token 数;证明冗余专家数理论上界,负载不均衡时仍维持高通信效率
FlashKDA基于 NVIDIA CUTLASS 的 KDA 高性能算子(此前已开源)在 NVIDIA H20 上 prefill 速度提升 1.72–2.22 倍;可作为 flash-linear-attention 库中 chunk_kda 的直接替代后端
AgentEnv与 KVCache.ai 联合开发的 Agent 沙箱(Firecracker microVM)面向大规模并行 Agent RL 训练;官方披露 checkpoint 延迟低至 133ms、恢复延迟 49ms、内存超分最高 6.5 倍(尚未经第三方独立复现)

跑分对比:和 GPT-5.6、Claude、GLM-4.5 比一比

不同机构、不同评测框架给出的数字差异较大,以下优先引用独立第三方复测数据。

模型SWE-bench Verified发布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 智能指数(max 推理档):Claude Fable 5(max + fallback)60 分;GPT-5.6 Sol(max)59 分;Kimi K3(max)约 57 分,全球第 3,开源模型第 1;GLM-5.2(max)51 分(此前的开源第一名);DeepSeek V4 Pro(max)44 分。

简单来说:它是开源阵营里能力天花板最高的选项,而不是性价比最高的选项。Kimi K3 目前在 Arena.ai 的 Frontend Code Arena 榜单上排名第一。

是「开源」还是「开放权重」?许可证里的两道商业门槛

月之暗面官方材料从未使用「open source」,一直采用「open weight(开放权重)」的表述。许可证包含两道此前 K2 系列都没有的商业门槛:

  1. Model-as-a-Service 收入门槛:如果被许可方运营「模型即服务」业务,且连续 12 个月内该业务累计收入超过 2000 万美元,必须与月之暗面另行签署商业协议。
  2. 规模展示门槛:如果产品月活用户超过 1 亿,或月收入超过 2000 万美元,必须在产品界面上显著展示「Kimi K3」字样。

对绝大多数中小团队和创业公司而言,这两道门槛几乎不会被触发,可以正常商用。

API 定价与自部署:能不能自己跑起来?

Token 类型价格(每百万 token)
输入(缓存命中)$0.30
输入(缓存未命中)$3.00
输出(含推理过程)$15.00

月之暗面提供 OpenAI SDK 兼容的 Chat Completions API(https://api.moonshot.ai/v1,模型 ID kimi-k3)。由于 Mooncake 分离式推理架构在典型编程类工作负载上缓存命中率可达 90% 以上,实际大部分调用成本会更接近 $0.30 这一档。

自部署方面:官方建议部署在 64 卡及以上的超节点配置上。对于个人开发者和大部分中小团队,更现实的路径是通过 OpenRouter 等第三方平台调用已托管好的 K3(目前已有 7 家服务商上线)。

python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "You are a senior software engineer."},
        {"role": "user", "content": "Refactor this function with type hints and docstrings."},
    ],
    max_tokens=4096,
)
print(response.choices[0].message.content)

六步 Runbook:K3 权重开源后的落地路径

  1. 厘清使用场景与合规边界:阅读自定义许可证全文,确认你的业务是否触及 Model-as-a-Service 收入门槛($2000 万/12 个月)或规模展示门槛(1 亿 MAU / $2000 万月收入)。若仅内部使用或中小规模商用,通常无额外限制。
  2. 选择接入路径:评估官方 API(Mooncake 缓存命中率高)、OpenRouter 多 provider 路由、或自部署(需 64 卡超节点)。参考OpenRouter API 集成指南配置 fallback 链。
  3. 按任务分层路由:简单对话走 Flash 档中国模型,复杂编程与 Agent 任务走 K3 max 推理档,极限困难任务保留 Claude Opus 5 / GPT-5.6 Sol——参考7 月 OpenRouter 分层路由示例
  4. 验证基准与成本:在你的真实工作负载上跑 SWE-bench 子集或内部评测集,对比 K3(约 $0.95/任务)与 GLM-5.2(约 $0.47/任务)的性价比曲线,避免「能力过剩」烧钱。
  5. 部署 Agent Gateway:在专用节点运行 OpenClaw / Hermes Agent / Kilo Code,将 K3 设为编程任务主模型,配置 429/超时自动降级;API Key 分环境管理,禁止硬编码进代码仓库。
  6. 建立 7×24 监控与成本告警:设日预算上限与缓存命中率监控;长会话 Agent 任务部署在专用 Mac 云主机,避免笔记本睡眠中断推理链路。

三条应写进技术评审的硬核数据

  • 全球首个完整开放的 3T 级模型:2.8T 总参数、1.56TB 权重体积,Hugging Face 上线 30 分钟内登顶趋势榜第一——此前没有任何 3 万亿参数级别模型被完整开放过。
  • 独立第三方 SWE-bench Verified:K3 得分 93.4%(Vals AI 复测),距 Claude Opus 5(97%)差 3.6 个百分点,但领先 DeepSeek-V4(76.2%)17.2 个百分点
  • FlashKDA 硬件加速:在 NVIDIA H20 上相比 flash-linear-attention 基线,prefill 速度提升 1.72–2.22 倍——长上下文场景的实际推理成本可能被显著拉低。

开源背后的地缘背景:WAIC 2026 与中美 AI 争端

Kimi K3 的开源节点卡在世界人工智能大会(WAIC 2026)窗口期,同时叠加了正在升级的中美「模型蒸馏」争端——就在权重开源前几天,美方指控月之暗面「工业化蒸馏」Anthropic 的模型来训练 K3,并威胁制裁;中国商务部则在 7 月 28 日公开回应,指责美方搞「AI 霸权主义」。在这样的背景下,月之暗面选择把权重、技术报告和三项核心 Infra 技术全部公开,某种程度上也是一种态度表达:用完整的工程细节自证技术路径的独立性。三天后,阿里巴巴发布了 24 万亿参数的 Qwen3.8-Max-Preview,被外界普遍解读为对 K3 的直接回应,国产大模型的竞争正式进入「3T 俱乐部」阶段。

自部署不现实时:为什么 Agent 栈仍需要专用节点

对绝大多数团队而言,K3 自部署的 64 卡门槛意味着API 调用是唯一现实路径。但即便走 API,生产级 Agent 工作流(OpenClaw、Hermes Agent、Kilo Code 对接 K3)仍面临三大隐性成本:笔记本合盖睡眠中断长会话、网络抖动导致推理链路断裂、API Key 散落在多台开发机无法统一轮换。这些与 K3 模型能力无关,却直接决定你能否把 93.4% 的 SWE-bench 能力稳定转化为业务产出。

若在本地笔记本上切换多模型 Gateway,上述问题会随上下文窗口拉长(K3 支持 100 万 token)而放大。对于更稳定、更适合 AI Agent 自动化的生产环境,MACCOME 的 Mac 云主机通常是更优解——真实 macOS、SSH 交接、环境隔离,让 K3 API 路由与 Agent Gateway 在专用实例上 7×24 稳定运行。方案与定价见Mac mini 云租用价格

数据来源:Moonshot AI 官方博客(kimi.com/blog/kimi-k3)、Hugging Face(moonshotai org)、GitHub(moonshotai/FlashKDA)、Vals AI SWE-bench Verified 排行榜、Artificial Analysis Intelligence Index、VentureBeat、Simon Willison's blog。发布前请以官方最新数据为准。

常见问题

Kimi K3 真的是开源模型吗?

严格来说不是。它属于「开放权重(open weight)」模型:训练完成的权重文件、技术报告和部分 Infra 工具是公开的,但训练数据和完整训练代码没有公开,不符合 OSI 标准下的「开源」定义。月之暗面官方始终使用 open weight,从未使用 open source。

Kimi K3 可以免费商用吗?

可以,绝大多数商业场景不受限制。但如果你运营的是「模型即服务」业务且年收入超过 2000 万美元,或产品月活超过 1 亿/月收入超过 2000 万美元,需要额外满足许可证中的特定条款。

Kimi K3 需要多少显卡才能自己部署?

官方建议部署在 64 卡及以上的超节点集群,个人和大部分企业用户更现实的方式是通过官方 API 或 OpenRouter 等第三方平台调用。详见7/16 K3 首发评测中的接入方式对比。

Kimi K3 的性能到底强不强?

在开源模型阵营中综合能力最强,Artificial Analysis 智能指数全球第 3,仅次于 Claude Fable 5 和 GPT-5.6 Sol;但成本高于同为开源的 GLM-5.2,属于「开源阵营天花板最高、但非性价比最优」的选择。蒸馏争议背景见Opus 5 与 K3 蒸馏门

Kimi K3 和 Kimi K2 有什么区别?

K3 参数规模是 K2.5 的约 3 倍,架构上新增了 Attention Residuals 和 Per-Head Muon,上下文窗口和多模态能力也大幅提升;许可证方面 K3 新增了 Model-as-a-Service 收入门槛,商业限制比 K2 系列更细化。

如何在生产环境 7×24 运行对接 K3 的 Agent 栈?

推荐在专用 Mac 云主机部署 OpenClaw / Hermes Agent 等 Gateway,配合 K3 API 或 OpenRouter 分层路由;避免笔记本睡眠中断长会话。查看MACCOME Mac 云租用方案获取节点配置与定价。