Kimi K3 完全オープンウェイト公開:2.8T パラメータ・100万コンテキスト、月之暗面の一手

約 22 分で読了 · MACCOME · 最終更新:2026年7月28日

対象読者:中国系大規模モデルのオープンウェイト動向を注視する技術責任者、AI 開発者、法務・コンプライアンス担当の方です。2026年7月27日 23 時、月之暗面(Moonshot AI)は Kimi K3 の完全モデル重みと技術レポートを公開し、MoonEP・FlashKDA・AgentEnv の 3 大 Infra を同時にオープンソース化しました——世界初の 3 兆パラメータ級モデルの完全公開(総パラメータ 2.8T、アクティブ約 1040 億、100 万 token コンテキスト)です。本稿で得られるもの:API 初公開から全面公開まで 11 日間のタイムライン、アーキテクチャ革新(KDA / AttnRes / Per-Head Muon)の解説、独立第三者ベンチマーク、ライセンス 2 つの商用ハードル、API 料金と自デプロイハードウェア要件、6 ステップ Runbook。構成:課題 → パラメータとアーキテクチャ → Infra 公開 → ベンチマークとライセンス → デプロイ選定 → FAQ → まとめ。7/16 K3 初公開レビュー蒸留論争7 月 OpenRouter ランキングと補完関係にあります。

bolt

TL;DR — 30 秒で把握

  • OSI 意味での「オープンソース」ではない:月之暗面は公式に常に open weight(オープンウェイト)と表記し、学習データと完全な学習コードは非公開です。
  • スペック上限:2.8T 総パラメータ、896 選 16 MoE、1M コンテキスト、重み約 1.56TB。Hugging Face 公開 30 分でトレンド 1 位を獲得しました。
  • 能力ポジション:Artificial Analysis 知能指数で世界第 3・オープンウェイト陣営第 1(約 57 点)。ただしタスクあたり約 $0.95 で GLM-5.2(約 $0.47)より高く、能力上限型でありコスパ最適解ではありません。
  • ライセンス 2 つの商用ハードル:Model-as-a-Service 年収 $2000 万超は別途契約。MAU 1 億超または月収 $2000 万超は「Kimi K3」表記が必須です。
  • 自デプロイの現実:公式推奨は 64 GPU 以上のスーパーノード。個人・中小チームは公式 API または OpenRouter(7 社が既に提供)が現実的です。

6 つの落とし穴:K3 重み公開後に陥りやすい盲点

  1. 「オープンウェイト」を「オープンソース」と混同する:メディアは「オープンソース」と訳すことが多いですが、月之暗面の公式資料は open source を一度も使用していません——学習済み重み、技術レポート、推論 Infra のみ公開で、OSI 基準には該当しません。
  2. ライセンスの商用ハードルを見落とす:K3 は Modified MIT ではなく完全カスタムライセンスです。Model-as-a-Service 収入ハードルと規模表示ハードルが新設されました——月之暗面と競合するモデル API 事業者にとっては法務上のレッドラインです。
  3. ベンチマーク数字の誤読:ベンダー自報と独立第三者の差は大きいです。SWE-bench Verified の独立再測定では K3 は 93.4%、Claude Opus 5(97%)と GPT-5.6 Sol(96.2%)を下回りますが、オープンウェイト陣営では依然トップクラスです。
  4. 能力だけを見てコストを無視する:K3 はタスクあたり約 $0.95。Claude Fable 5(約 $2.4)より 60% 安い一方、GLM-5.2(約 $0.47)の 2 倍——オープンウェイト陣営の能力上限であり、コスパ最適解ではありません。
  5. 自デプロイハードウェア要件の過小評価:2.8T パラメータ・896 エキスパートの規模は、コンシューマー級ハードウェアでの実行を事実上不可能にします。公式は 64 GPU 以上のスーパーノードを推奨しています。
  6. ノート PC で百万コンテキスト Agent 長セッションを走らせる:7×24 オンライン Gateway が前提です。フタ閉じスリープ、ネットワーク揺らぎ、API Key 散在はモデル能力とは無関係な三大の隠れコストです。

タイムライン:API 初公開から全面公開まで 11 日

  • 7 月 16 日夜(WAIC 2026 前夜):kimi.com、Kimi Work、Kimi Code、Kimi API で K3 初公開。オンライン呼び出しのみで重みは未公開。公式技術ブログタイトルは《Kimi K3: Open Frontier Intelligence》。
  • 7 月 17 日:業界がアーキテクチャ分析を集中開始。新華社は「現時点で世界最大パラメータのオープンソースモデル」と報じました。
  • 7 月 22–23 日:米中「モデル蒸留」争いが激化。米ホワイトハウス科学技術顧問 Michael Kratsios が月之暗面の Anthropic Fable モデルに対する「大規模・隠蔽的な工業化蒸留」を指摘。財務長官 Scott Bessent は関連中国企業への制裁と「实体リスト」制限を検討すると表明しました。
  • 7 月 27 日 23 時:月之暗面が K3 完全重み・技術レポートを公開。MoonEP・AgentEnv を同時オープンソース化(FlashKDA は既に公開済み)。
  • 7 月 28 日:中国商務部が米中 AI 争いに公開回答。米国の「AI 覇権主義」を非難し反制措置を警告。国内メディアが今回の公開詳細を追報しました。

今回の公開は kimi.com と API 側での K3 初公開からわずか 11 日後です。Hugging Face 上の重みファイルは約 1.56TB、公開 30 分以内にトレンドランキング 1 位を獲得しました。

Kimi K3 コアパラメータ一覧

項目パラメータ
総パラメータ数2.8 兆(2.8T)
アクティブパラメータ数1040 億(104B)
アーキテクチャ混合エキスパート(MoE)
エキスパート構成896 ルーティングエキスパート、token あたり 16 個アクティブ(共有エキスパートあり)
アテンション機構Kimi Delta Attention(KDA)+ ゲート付き MLA
コンテキストウィンドウ100 万 token
マルチモーダルネイティブビジョン理解(ViT-V2、27 層)
重み形式MXFP4 重み + MXFP8 活性化(SFT 段階から量子化認識学習)
重みサイズ約 1.56TB(Hugging Face)
Licenseカスタムライセンス(公式表記:open weight、非 open source)

3 大アーキテクチャ革新:KDA、AttnRes、Per-Head Muon

Kimi K3 は深層学習の 3 大伝統コンポーネント——アテンション、残差接続、最適化器——を再設計しました。単純なパラメータ積み上げとの決定的な差異です。

Kimi Delta Attention(KDA):より精緻な「忘却」

従来の Gated DeltaNet はスカラー級の忘却ゲートを用います。KDA はチャネルごとの独立した減衰率を持たせ、長期保持と短期忘却を次元単位で制御します。chunkwise DPLR 公式により線形時間再帰を実現し、100 万 token コンテキストで KV Cache オーバーヘッドを極小化しています。

Attention Residuals(AttnRes):残差接続の選択的集約

従来の残差接続は層出力を均等に累積します。AttnRes は入力に応じて過去全層の出力を動的に選択集約し、約 25% の学習効率向上(パラメータコスト 2% 未満)を達成しています。

Per-Head Muon:アテンションヘッド単位の独立最適化

Muon 最適化器をヘッド単位に拡張し、各アテンションヘッドがより適応的な収束経路を持ちます。API 利用者には不可視の学習期技術ですが、少ないアクティブパラメータでトップ級性能を実現する要因の一つです。

Stable LatentMoE:896 選 16 のスパース設計

896 ルーティングエキスパートから token あたり 16 個のみアクティブ(スパース度約 1.8%)。Quantile Balancing と MoonEP により、各計算ノードの冗長エキスパート数の理論的上界を証明しています。

3 大オープンソース Infra:重みだけでなく工程能力一式

技術位置づけ主要能力
MoonEP超大規模細粒度 MoE 高性能通信ライブラリ過負荷エキスパートの一時複製で各ノードの token 数を均等化。冗長エキスパート数の理論的上界を証明
FlashKDANVIDIA CUTLASS ベースの KDA 高性能演算子(既公開)NVIDIA H20 で prefill 1.72–2.22 倍高速化。flash-linear-attentionchunk_kda 直接代替バックエンド
AgentEnvKVCache.ai 共同開発の Agent サンドボックス(Firecracker microVM)大規模並列 Agent RL 学習向け。公式値:checkpoint 133ms、復旧 49ms、メモリ超分最大 6.5 倍(第三者独立再現は未確認)

ベンチマーク比較:GPT-5.6、Claude、GLM との横並び

機関・評価フレームワークにより数字は大きく異なります。以下は独立第三者の再測定データを優先しています。

モデルSWE-bench Verified公開日
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 知能指数(max 推論ティア):Claude Fable 5(max + fallback)60 点、GPT-5.6 Sol(max)59 点、Kimi K3(max)約 57 点——世界第 3、オープンウェイト第 1、GLM-5.2(max)51 点、DeepSeek V4 Pro(max)44 点。

要約すると、オープンウェイト陣営の能力上限であり、コスパ最適解ではありません。K3 は Arena.ai Frontend Code Arena でも 1 位を記録しています。

「オープンソース」か「オープンウェイト」か:ライセンス 2 つの商用ハードル

月之暗面の公式資料は一度も open source を使用していません。常に open weight(オープンウェイト)です。K2 系列になかった 2 つの商用ハードルが新設されました。

  1. Model-as-a-Service 収入ハードル:連続 12 か月で MaaS 事業収入が $2000 万を超える場合、月之暗面との別途商用契約が必要です。
  2. 規模表示ハードル:MAU 1 億超、または月収 $2000 万超の製品は、UI に「Kimi K3」を顕著に表示する必要があります。

大多数の中小チーム・スタートアップには該当せず、通常どおり商用利用できます。

API 料金と自デプロイ:自分で動かせるか

Token 種別価格(100 万 token あたり)
入力(キャッシュヒット)$0.30
入力(キャッシュミス)$3.00
出力(推論過程含む)$15.00

月之暗面は OpenAI SDK 互換 Chat Completions API(https://api.moonshot.ai/v1、モデル ID kimi-k3)を提供しています。Mooncake 分離型推論アーキテクチャにより、典型的なプログラミングワークロードではキャッシュヒット率 90% 超が可能で、実コストは $0.30 ティアに近づきます。

自デプロイは公式推奨 64 GPU 以上のスーパーノードです。個人・中小チームには OpenRouter 等の第三者プラットフォーム(既に 7 社が K3 を提供)が現実的です。

python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "system", "content": "You are a senior software engineer."},
        {"role": "user", "content": "Refactor this function with type hints and docstrings."},
    ],
    max_tokens=4096,
)
print(response.choices[0].message.content)
warning

本番運用の注意:64 GPU スーパーノードは大多数のチームにとって非現実的です。API 経由でも、長セッション Agent は専用 7×24 ノード上の Gateway 配置が推奨されます。429 / タイムアウト時の fallback チェーンを必ず設定してください。

6 ステップ Runbook:K3 重み公開後の導入パス

  1. 利用シーンとコンプライアンス境界の整理:カスタムライセンス全文を読み、MaaS 収入ハードル($2000 万/12 か月)または規模表示ハードル(1 億 MAU / $2000 万月収)に該当するか確認します。内部利用・中小規模商用なら通常追加制限はありません。
  2. 接続パスの選定:公式 API(Mooncake 高キャッシュヒット率)、OpenRouter マルチ provider ルーティング、自デプロイ(64 GPU スーパーノード必要)を評価します。OpenRouter API 統合ガイドで fallback チェーンを構成してください。
  3. タスク別階層ルーティング:簡単な対話は Flash ティアの中国モデル、複雑なプログラミング・Agent は K3 max 推論ティア、極限困難タスクは Claude Opus 5 / GPT-5.6 Sol を保留——7 月 OpenRouter 階層ルーティング例を参照してください。
  4. ベンチマークとコストの検証:実ワークロードで SWE-bench サブセットまたは内部評価集を実行し、K3(約 $0.95/タスク)と GLM-5.2(約 $0.47/タスク)のコスパ曲線を比較します。「能力過剰」によるコスト浪費を避けてください。
  5. Agent Gateway のデプロイ:専用ノードで OpenClaw / Hermes Agent / Kilo Code を稼働し、K3 をプログラミング主モデルに設定。429 / タイムアウト時の自動降格を構成し、API Key は環境別管理(コードリポジトリへのハードコード禁止)を徹底します。
  6. 7×24 監視とコストアラート:日次予算上限とキャッシュヒット率を監視します。長セッション Agent は専用 Mac クラウドホストに配置し、ノート PC スリープによる推論リンク中断を避けてください。

技術レビューに記載すべき 3 つのハードデータ

  • 世界初の完全公開 3T 級モデル:2.8T 総パラメータ、1.56TB 重み。Hugging Face 公開 30 分でトレンド 1 位——これまで 3 兆パラメータ級モデルの完全公開はありませんでした。
  • 独立第三者 SWE-bench Verified:K3 93.4%(Vals AI 再測)。Claude Opus 5(97%)との差 3.6 ポイントですが、DeepSeek-V4(76.2%)より 17.2 ポイント先行しています。
  • FlashKDA ハードウェア加速:NVIDIA H20 で flash-linear-attention 基線比 prefill 1.72–2.22 倍——長コンテキスト推論コストを大幅に圧縮する可能性があります。

公開の地政学背景:WAIC 2026 と米中 AI 争い

K3 公開は世界人工知能大会(WAIC 2026)の窗口期と重なり、米中「モデル蒸留」争いの激化期でもあります。重み公開の直前、米側は月之暗面の Anthropic モデル「工業化蒸留」を指摘し制裁を警告。7 月 28 日、中国商務部は「AI 覇権主義」を非難し反制を表明しました。月之暗面が重み・技術レポート・3 大 Infra をすべて公開したのは、技術経路の独立性を工程詳細で示す姿勢でもあります。3 日後、阿里巴巴が 24 兆パラメータの Qwen3.8-Max-Preview を発表し、K3 への直接応答と見られています——国産大規模モデル競争は「3T クラブ」段階に入りました。

自デプロイが非現実的なとき:Agent スタックに専用ノードが必要な理由

大多数のチームにとって、64 GPU 要件はAPI 呼び出しが唯一の現実的パスです。しかし API 経由でも、OpenClaw・Hermes Agent・Kilo Code と K3 を接続した本番 Agent ワークフローには三大の隠れコストがあります——ノート PC スリープによる長セッション中断、ネットワーク揺らぎによる推論リンク断絶、複数開発機に散在する API Key のローテーション不能。これらは K3 の 93.4% SWE-bench 能力とは無関係ですが、ビジネス成果への転化を左右します。

100 万 token コンテキストほど、上記問題は長セッション Agent で拡大します。より安定した AI Agent 自動化の本番環境には、MACCOME Mac クラウドホストが適しています——実 macOS、SSH 引き継ぎ、環境分離により、K3 API ルーティングと Agent Gateway を専用インスタンスで 7×24 安定稼働できます。プランと料金はMac mini レンタル価格をご覧ください。

データ出典:Moonshot AI 公式ブログ(kimi.com/blog/kimi-k3)、Hugging Face(moonshotai org)、GitHub(moonshotai/FlashKDA)、Vals AI SWE-bench Verified ランキング、Artificial Analysis Intelligence Index、VentureBeat、Simon Willison's blog。公開前は公式最新データをご確認ください。

よくある質問

Kimi K3 は本当にオープンソースモデルですか?

厳密にはいいえ。オープンウェイト(open weight)モデルです。学習済み重み、技術レポート、一部 Infra ツールは公開されていますが、学習データと完全な学習コードは非公開で、OSI 基準のオープンソース定義には該当しません。月之暗面は公式に常に open weight と表記し、open source は使用していません。

Kimi K3 は商用利用できますか?

はい。大多数の商用シーンでは制限がありません。ただし Model-as-a-Service 事業で年収が 2000 万ドルを超える場合、または MAU 1 億超 / 月収 2000 万ドル超の製品では、ライセンスの追加条項を満たす必要があります。

Kimi K3 を自社デプロイするには何枚の GPU が必要ですか?

公式は 64 GPU 以上のスーパーノードクラスタを推奨しています。個人や大多数の企業には公式 API または OpenRouter 等の第三者プラットフォームが現実的です。詳細は7/16 K3 初公開レビューの接続方式比較をご覧ください。

Kimi K3 の性能はどの程度ですか?

オープンウェイト陣営では総合能力が最も高く、Artificial Analysis 知能指数で世界第 3(Claude Fable 5 と GPT-5.6 Sol に次ぐ)。ただし GLM-5.2 よりコストが高く、「オープンウェイト陣営の能力上限だがコスパ最適解ではない」選択肢です。蒸留論争の背景はOpus 5 と K3 蒸留問題を参照してください。

Kimi K3 と Kimi K2 の違いは何ですか?

K3 のパラメータ規模は K2.5 の約 3 倍です。アーキテクチャに Attention Residuals と Per-Head Muon を新設し、コンテキストとマルチモーダル能力も大幅向上しています。ライセンス面では K3 に MaaS 収入ハードルが新設され、K2 系列より商用制限が細分化されています。

本番環境で K3 接続 Agent スタックを 7×24 運用するには?

専用 Mac クラウドホストに OpenClaw / Hermes Agent 等の Gateway をデプロイし、K3 API または OpenRouter 階層ルーティングと組み合わせることを推奨します。ノート PC スリープによる長セッション中断を避けてください。MACCOME Mac レンタルプランでノード構成と料金を確認できます。