Claude Opus 5 價格減半逼近旗艦實力,Kimi K3 卻陷「自稱 Claude」蒸餾門:本週 AI 圈兩大瓜

約 18 分鐘閱讀 · MACCOME · 最後更新:2026 年 7 月 25 日

適用讀者:正在評估 Claude / Kimi 選型、關注 AI 合規與供應鏈風險的開發者與技術負責人。本週兩件大事表面無關,實則都指向「性價比」與「模型能力真實來源」:7 月 24 日 Anthropic 發布 Claude Opus 5 並設為 Claude Max 預設模型;7 月 16 日上線的 Kimi K3 則遭白宮公開指控「蒸餾 Claude」,且獨立研究者發現 K3 會自稱是 Claude 並吐出內部部署 ID。你將獲得:Opus 5 與 Fable 5 對比表、K3 蒸餾門完整時間線、Greenblatt 技術證據解讀、六步選型 Runbook 與 FAQ。結構:痛點 → Opus 5 解讀 → K3 爭議 → 對比矩陣 → Runbook → 收束轉化。K3 參數與基準詳見Kimi K3 深度評測

bolt

TL;DR — 30 秒結論

  • Opus 5(7/24):定價與 Opus 4.8 相同($5/$25 per 1M),CursorBench 3.2 峰值僅比 Fable 5 低 0.5%,成本約一半;Claude Max 預設模型,預設不強制資料留存。
  • K3 蒸餾門(7/22–24):白宮 OSTP 主任 Kratsios 指控「隱蔽工業級蒸餾」+ 違規 GB300 晶片;專家質疑 Fable 5 公開僅兩週、時間線不夠。
  • 最硬核證據:Redwood Research 的 Ryan Greenblatt 發現 K3 異常高頻自稱 Claude,甚至吐出 claude-opus-4-5-20250929 等內部 ID——比真 Claude 自己報得還準。
  • 7/27 待驗證:K3 完整權重承諾 7 月 27 日放出,外部尚無法獨立複現架構與跑分。

六大痛點:本週兩大事件下,開發者最容易踩的坑

  1. 把「半價 Opus」誤讀成「全面替代 Fable 5」:Opus 5 在 Agent 程式設計與自動化上接近旗艦,但 Anthropic 故意未讓其在網路安全攻擊、生物安全等雙用途能力上刷前沿——Mythos 5 仍占該位。
  2. 把白宮喊話當已證實事實:Kratsios 與 Bessent 的公開指控未附可核查證據;月之暗面對訓練過程質詢未予回應,但「未回應 ≠ 有罪」。
  3. 忽略蒸餾時間線:Fable 5 7 月 1 日才面向公眾開放,到 K3 發布(7/16)僅兩週——深度 RL 式蒸餾在算力與 API 成本上極難完成,多位獨立研究者據此存疑。
  4. 忽略「K3 自稱 Claude」的技術訊號:這比政治表態更有分析價值——指向訓練資料可能混入帶部署元資料標註的 Claude 樣本,但 Greenblatt 強調不能直接證明蒸餾發生
  5. 合規與資料留存盲區:Fable 5 / Mythos 5 需接受 30 天資料留存;Opus 5 延續 Opus 系列預設不強制留存——企業場景選型須單獨核對。
  6. 在筆電上跑多模型 Agent 堆疊:Opus 5 + K3 混合路由、長上下文工作階段與 Gateway 需要 7×24 線上節點,本機合蓋即斷鏈。

Claude Opus 5 發布:不是旗艦,但可能是最值得用的 Claude

2026 年 7 月 24 日(美國太平洋時間),Anthropic 正式發布 Claude Opus 5(模型 ID:claude-opus-5),並同步將其設為 Claude Max 預設模型,Claude Pro 使用者也可使用當前最強 Opus 檔位。定位清晰:日常主力模型,智能水準接近旗艦 Fable 5,價格約為 Fable 5 的一半。

價格沒變,效能「跳級」

Opus 5 定價與 Opus 4.8 完全相同:輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens。100 萬 token 上下文為預設且唯一檔位,最大輸出 128K;Thinking 預設開啟,由 Effort 參數控制思考量。Fast 模式速度約為預設 2.5 倍,價格為基礎價 2 倍。

Anthropic 官方基準 Highlights:

  • Frontier-Bench v0.1(軟體工程):超越所有模型,為 Opus 4.8 的兩倍以上,且單任務成本更低。
  • CursorBench 3.2:max effort 下與 Fable 5 峰值相差僅 0.5%,成本約 Fable 5 一半;high / xhigh / max 檔「同成本表現」均超過市面所有模型。
  • ARC-AGI 3(新穎問題):得分為「次優模型」的3 倍
  • OSWorld 2.0(電腦操作):用不到 Fable 5 三分之一成本超過 Fable 5 最佳成績。
  • Zapier AutomationBench:端到端商業自動化通過率約為次優模型 1.5 倍;最低 effort 檔通過任務數仍超其他任何模型;Zapier 稱 Opus 5 在該基準100% 通過此前模型無法完成的任務。

Cursor 團隊評價:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」

科研與企業實測

結構生物學、有機化學、生物資訊學全面超過 Opus 4.8:從光譜推斷分子結構內部評測高 10.2 個百分點;蛋白質序列變異功能預測高 7.7 個百分點。Box 客戶資料:資料分析工作流 +11%,盡職調查 +17%,整體準確率 +8%。

對齊與安全:最「聽話」的一代,但故意未刷雙用途前沿

自動化行為稽核顯示 Opus 5 是迄今為止最對齊的 Claude:欺騙行為率最低、最難被誘導濫用。但在風險型雙用途能力(網路攻擊、生物安全)上未刷新前沿,仍由受限發行的 Mythos 5 保持。網路安全分類器比 Fable 5 寬鬆約 85%——可用於原始碼級漏洞發現,仍屏蔽二進位漏洞掃描、滲透測試、exploit 生成等。

易被忽略:預設不強制資料留存

Opus 5 與歷代 Opus 一致,預設存取不強制資料留存;Fable 5 / Mythos 5 需接受 30 天資料留存政策。合規敏感場景下,這可能是選 Opus 5 而非 Fable 5 的關鍵理由。

維度Claude Opus 5Claude Fable 5
發布日期2026-07-242026-06-09(7/1 公眾可用)
輸入 / 輸出定價$5 / $25 per 1M tokens約 $10 / $50 per 1M tokens
CursorBench 3.2(max)與 Fable 5 峰值差 0.5%峰值基準
Claude Max 預設是(發布日起)
資料留存預設不強制需接受 30 天留存
雙用途前沿(網安/生物)故意未刷前沿更強(Mythos 5 受限最強)

Kimi K3「蒸餾門」:白宮下場,專家吐槽時間線,Greenblatt 挖出新證據

若 Opus 5 是「正常發新品」,Kimi K3 的劇情則複雜得多。月之暗面 7 月 16 日發布 K3(2.8T 參數、1M 上下文、稀疏 MoE),官方自稱整體能力僅次於 Fable 5 與 GPT-5.6 Sol;完整權重承諾 7 月 27 日 放出——爭議爆發時外部尚無法獨立驗證。

白宮突然下場

2026 年 7 月 22–23 日,白宮科技政策辦公室(OSTP)主任 Michael Kratsios 在 X 發文,指控月之暗面透過「大規模、隱蔽的產業級蒸餾(distillation)」竊取 Anthropic Fable 模型能力,並提及涉嫌使用未獲出口許可的 Nvidia GB300 晶片(可能經泰國伺服器間接取得)。財政部長 Scott Bessent 附和稱在「很多中國模型上發現了美國大模型的浮水印」,但未說明浮水印具體指什麼。

這並非空穴來風:2026 年 2 月 Anthropic 已公開指控月之暗面、DeepSeek、MiniMax「產業級蒸餾攻擊」,稱識別出月之暗面超過 340 萬次異常 API 互動,「明顯偏離正常使用模式」,並稱已透過請求元資料追蹤到部分行為與月之暗面高層相關。月之暗面從未正面確認或否認。

獨立專家:時間根本不夠

TechCrunch(7/23)採訪多位研究者,普遍對「兩週內蒸餾出 K3」存疑。Snorkel AI 共同創辦人 Braden Hancock:

「Fable 從 7 月 1 日才開始公開可用,你不可能在兩週內蒸餾出這麼多資料、訓練完模型還發布出來。」

Allen Institute for AI 研究員 Nathan Lambert 認為,隨著中國模型逼近前沿,簡單監督微調式蒸餾邊際收益變小,真正拉開差距的是更耗時的強化學習——若蒸餾真這麼好用,追趕者早該靠蒸餾追平 GLM 或 K3,但事實並非如此。

Elon Musk 曾在庭審中承認 xAI 訓練 Grok 時蒸餾過 OpenAI 模型,並稱業界常見——「蒸餾」本身不違法,核心在於「正常技術借鑑」與「隱蔽工業級竊取」的邊界如何界定。

最硬核證據:K3 會「自稱是 Claude」

Redwood Research 首席科學家 Ryan Greenblatt(7/24 左右,GitHub:rgreenblatt/which_claude_is_k3)對多模型身份自認行為做交叉熵對比,發現:

  • Kimi K3 異常高頻自稱 Claude,甚至吐出 Claude 官方內部部署 ID,如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929
  • 真正的 Claude Sonnet 4.5 只會說「我是 Claude Sonnet 4.5」;Opus 4.5 往往不報或報錯版本號——教師模型自己都沒有 K3 報得準
  • K3 自稱版本鎖定在「Claude 4.5 世代」(2025 年末),而非當前 Fable/Mythos;上一代 K2 訊號指向更早的 Claude Sonnet 4——呈現「逐代追新」規律。

Greenblatt 解讀:更可能指向訓練資料混入帶部署元資料標註的 Claude 資料(API 日誌或打標合成資料),是一種更具體、更難用「模仿對話風格」解釋的蒸餾形式。但他強調:這些發現不能直接證明蒸餾發生——身份混淆也可能來自資料污染、系統提示洩漏或公開資料集合樣本。

社群態度:吃瓜之外,更在乎能不能用、值不值

Reddit r/LocalLLaMA 上三方聲音:歡呼開源與閉源差距縮短到「天」而非「月」;調侃 2.8T 幾乎沒人本地跑;務實派認為 K3 賣點是低價 + 少拒答,而非「打敗 Fable 5」。7 月 27 日權重放出前,架構與跑分仍無法外部獨立驗證。

日期事件
2026-02Anthropic 首次公開指控月之暗面/DeepSeek/MiniMax「產業級蒸餾攻擊」(340 萬+ 異常互動)
2026-07-01Claude Fable 5 面向公眾開放
2026-07-16Kimi K3 API/產品正式發布(2.8T,完整權重待 7/27)
2026-07-22/23白宮 OSTP 主任 Kratsios 公開指控蒸餾 + 違規晶片
2026-07-23TechCrunch 刊發專家質疑蒸餾時間線
2026-07-24Claude Opus 5 發布;Greenblatt 發布「K3 自稱 Claude」統計
2026-07-27(計畫)Kimi K3 完整權重開源,外部可獨立驗證

Claude Opus 5 vs Kimi K3:本週事件後的快速決策矩陣

選型維度傾向 Claude Opus 5傾向 Kimi K3(待 7/27 驗證)
合規 / 資料留存預設不強制留存;Anthropic 企業鏈路成熟開源權重 + 低價,但蒸餾指控與供應鏈風險未澄清
Agent / 程式設計CursorBench、AutomationBench、OSWorld 官方資料領先Program Bench、SWE Marathon 自報強,外部複現待權重
成本半價 Fable 級能力,$5/$25官方定位大幅低於 Fable 5 / GPT-5.6 Sol
審查 / 拒答對齊最強一代,雙用途仍有限制社群認為「少拒答」是真實賣點之一
可驗證性已全面可用(API / Bedrock / Vertex 等)7/27 前架構與跑分無法獨立驗證

六步 Runbook:本週兩大事件後如何落地選型與 Agent 部署

  1. 明確場景優先級:若 Agent 程式設計、自動化與合規留存是核心,優先評估 Opus 5(及程式設計助手選型矩陣中的組合堆疊);若極限成本 + 開源可控,標記 7/27 後複測 K3。
  2. 核對資料留存與合規條款:企業場景對比 Opus 5(預設不強制留存)與 Fable 5 / Mythos 5(30 天留存 opt-in);涉及跨境或政企專案單獨做法務評審。
  3. 用 Effort 檔位做成本探測:Opus 5 Thinking 預設開啟——對 CursorBench 類任務可先用 high/max 測品質,再用較低 effort 測 Zapier 類自動化是否仍達標,避免 token 浪費。
  4. 對 K3 保持「證據分級」:政治指控(白宮)→ 時間線反駁(專家)→ 技術間接證據(Greenblatt)分三層記錄,7/27 權重放出後跑 identity prompt 與 benchmark 複現。
  5. 設定多模型 Gateway:在專用節點部署 OpenClaw 或 Kimi Code + OpenRouter 路由,避免筆電睡眠中斷長工作階段;API Key 與 provider fallback 分環境隔離。
  6. 7/27 後追更驗證:權重公開後對比 GPQA-Diamond、BrowseComp 與「你是誰」identity 測試,更新內部模型路由表並歸檔決策依據。

三條應寫進技術評審的硬核資料

  • Opus 5 / Fable 5 性價比剪刀差:CursorBench 3.2 max effort 峰值相差 0.5%,token 單價約為 Fable 5 的 50%($5/$25 vs 約 $10/$50 per 1M)——Anthropic 用「半價逼近旗艦」直接回應市場性價比訴求。
  • ARC-AGI 3 三倍 gap:Opus 5 在「沒見過的新問題」評測得分為次優模型的 3 倍,OSWorld 2.0 用 <1/3 Fable 成本超 Fable 最佳——Agent 泛化與電腦操作是本次發布最亮眼的量化訊號。
  • K3 身份混淆統計:Greenblatt 交叉熵分析顯示 K3 在被問「你是誰」時disproportionately 輸出 Claude 內部部署 ID(如 claude-opus-4-5-20250929),且版本鎖定 Claude 4.5 世代而非 Fable/Mythos——這是蒸餾爭議中迄今最具技術含金量、競爭最小的英文長尾角度Why does Kimi K3 say it's Claude)。

兩件事放在一起看:性價比才是主戰場

Opus 5 用「半價逼近旗艦」回應市場對性價比的訴求;Kimi K3 用「開源 + 低價 + 少限制」衝擊市場;圍繞 K3 的爭議,本質是各家在性價比戰爭裡對「你的低價是靠技術優化還是靠白嫖別人模型」的公開攤牌。

對普通開發者與企業:先看場景,再看立場。合規、資料留存、供應鏈敏感 → Opus 5 性價比很高;極限成本與開源可控 → 等 7/27 權重後再實測 K3。

若在本地筆電上切換 Opus 5 / K3 / 多 provider Gateway,合蓋睡眠、網路抖動與金鑰散落是三大隱性成本——長工作階段 Agent 與自動化任務需要專用 7×24 線上節點。MACCOME Mac 雲主機提供真實 macOS、SSH 交接與環境隔離,讓 Claude Code、OpenClaw 與多模型路由在專用執行個體上穩定運行。方案與定價見Mac mini 雲端租用價格

資料來源:Anthropic 官方發布(anthropic.com/news/claude-opus-5)、Moonshot/Kimi 技術部落格、TechCrunch、Ryan Greenblatt GitHub(rgreenblatt/which_claude_is_k3)、CNBC / The Verge。基準為各廠商自報或第三方統計,截止 2026 年 7 月 25 日。

常見問題

Claude Opus 5 比 Claude Fable 5 便宜多少?

在相同 token 單價結構下,Opus 5 約為 Fable 5 的一半(Fable 5 約 $10/$50 每百萬輸入/輸出 token,Opus 5 維持 $5/$25);CursorBench 3.2 峰值與 Fable 5 相差不到 1%。

Claude Opus 5 現在是 Claude Max 的預設模型嗎?

是的,2026 年 7 月 24 日發布當天起 Opus 5 成為 Claude Max 預設模型,也是 Claude Pro 使用者可用的最強版本。

Kimi K3 真的蒸餾了 Claude 嗎?

截至本文發布仍屬爭議、未被最終證實。白宮指控缺乏公開證據;獨立專家從時間線認為兩週內深度蒸餾不現實;Ryan Greenblatt 發現的「K3 自稱是 Claude 並吐出內部版本號」是目前最具技術含量的間接證據。詳見Kimi K3 深度評測

Kimi K3 的完整權重什麼時候能下載?

官方承諾 2026 年 7 月 27 日;本文發布時尚未放出,外部研究者尚無法完全獨立驗證架構與跑分。

為什麼 Kimi K3 會說自己是 Claude?

Greenblatt 的統計分析顯示 K3 在被問身份時異常高頻輸出 Claude 及內部部署 ID(如 claude-opus-4-5-20250929),比真 Claude 自己報得還準——可能指向訓練資料混入帶元資料標註的 Claude 樣本,但不能單獨證明蒸餾;也可能是資料污染或提示洩漏。

如何在生產環境 7×24 運行 Opus 5 / K3 混合 Agent?

建議在專用 Mac 雲主機部署 Gateway 與多 provider 路由,避免筆電睡眠中斷。查看MACCOME Mac 雲端租用方案取得節點設定與定價。