Claude Opus 5价格减半逼近旗舰实力,Kimi K3却陷"自称Claude"蒸馏门:本周AI圈两大瓜

约 18 分钟阅读 · MACCOME · 最后更新:2026 年 7 月 25 日

适用读者:正在评估 Claude / Kimi 选型、关注 AI 合规与供应链风险的开发者与技术负责人。📌 本周两件大事表面无关,实则都指向「性价比」与「模型能力真实来源」:7 月 24 日 Anthropic 发布 Claude Opus 5 并设为 Claude Max 默认模型;7 月 16 日上线的 Kimi K3 则遭白宫公开指控「蒸馏 Claude」,且独立研究者发现 K3 会自称是 Claude 并吐出内部部署 ID。你将获得:Opus 5 与 Fable 5 对比表、K3 蒸馏门完整时间线、Greenblatt 技术证据解读、六步选型 Runbook 与 FAQ。结构:痛点 → Opus 5 解读 → K3 争议 → 对比矩阵 → Runbook → 收束转化。K3 参数与基准详见Kimi K3 深度评测

bolt

TL;DR — 30 秒结论

  • Opus 5(7/24):定价与 Opus 4.8 相同($5/$25 per 1M),CursorBench 3.2 峰值仅比 Fable 5 低 0.5%,成本约一半;Claude Max 默认模型,默认不强制数据留存。
  • K3 蒸馏门(7/22–24):白宫 OSTP 主任 Kratsios 指控「隐蔽工业级蒸馏」+ 违规 GB300 芯片;专家质疑 Fable 5 公开仅两周、时间线不够。
  • 最硬核证据:Redwood Research 的 Ryan Greenblatt 发现 K3 异常高频自称 Claude,甚至吐出 claude-opus-4-5-20250929 等内部 ID——比真 Claude 自己报得还准。
  • 7/27 待验证:K3 完整权重承诺 7 月 27 日放出,外部尚无法独立复现架构与跑分。

六大痛点:本周两大事件下,开发者最容易踩的坑

  1. 把「半价 Opus」误读成「全面替代 Fable 5」:Opus 5 在 Agent 编程与自动化上接近旗舰,但 Anthropic 故意未让其在网络安全攻击、生物安全等双用途能力上刷前沿——Mythos 5 仍占该位。
  2. 把白宫喊话当已证实事实:Kratsios 与 Bessent 的公开指控未附可核查证据;月之暗面对训练过程质询未予回应,但「未回应 ≠ 有罪」。
  3. 忽视蒸馏时间线:Fable 5 7 月 1 日才面向公众开放,到 K3 发布(7/16)仅两周——深度 RL 式蒸馏在算力与 API 成本上极难完成,多位独立研究者据此存疑。
  4. 忽略「K3 自称 Claude」的技术信号:这比政治表态更有分析价值——指向训练数据可能混入带部署元数据标注的 Claude 样本,但 Greenblatt 强调不能直接证明蒸馏发生
  5. 合规与数据留存盲区:Fable 5 / Mythos 5 需接受 30 天数据留存;Opus 5 延续 Opus 系列默认不强制留存——企业场景选型须单独核对。
  6. 在笔记本上跑多模型 Agent 栈:Opus 5 + K3 混合路由、长上下文会话与 Gateway 需要 7×24 在线节点,本地合盖即断链。

Claude Opus 5 发布:不是旗舰,但可能是最值得用的 Claude

2026 年 7 月 24 日(美国太平洋时间),Anthropic 正式发布 Claude Opus 5(模型 ID:claude-opus-5),并同步将其设为 Claude Max 默认模型,Claude Pro 用户也可使用当前最强 Opus 档位。定位清晰:日常主力模型,智能水平接近旗舰 Fable 5,价格约为 Fable 5 的一半。

价格没变,性能「跳级」

Opus 5 定价与 Opus 4.8 完全相同:输入 $5 / 百万 tokens,输出 $25 / 百万 tokens。100 万 token 上下文为默认且唯一档位,最大输出 128K;Thinking 默认开启,由 Effort 参数控制思考量。Fast 模式速度约为默认 2.5 倍,价格为基础价 2 倍。

Anthropic 官方基准 Highlights:

  • Frontier-Bench v0.1(软件工程):超越所有模型,为 Opus 4.8 的两倍以上,且单任务成本更低。
  • CursorBench 3.2:max effort 下与 Fable 5 峰值相差仅 0.5%,成本约 Fable 5 一半;high / xhigh / max 档「同成本表现」均超过市面所有模型。
  • ARC-AGI 3(新颖问题):得分为「次优模型」的3 倍
  • OSWorld 2.0(计算机操作):用不到 Fable 5 三分之一成本超过 Fable 5 最佳成绩。
  • Zapier AutomationBench:端到端商业自动化通过率约为次优模型 1.5 倍;最低 effort 档通过任务数仍超其他任何模型;Zapier 称 Opus 5 在该基准100% 通过此前模型无法完成的任务。

Cursor 团队评价:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」

科研与企业实测

结构生物学、有机化学、生物信息学全面超过 Opus 4.8:从光谱推断分子结构内部评测高 10.2 个百分点;蛋白质序列变异功能预测高 7.7 个百分点。Box 客户数据:数据分析工作流 +11%,尽职调查 +17%,整体准确率 +8%。

对齐与安全:最「听话」的一代,但故意未刷双用途前沿

自动化行为审计显示 Opus 5 是迄今为止最对齐的 Claude:欺骗行为率最低、最难被诱导滥用。但在风险型双用途能力(网络攻击、生物安全)上未刷新前沿,仍由受限发行的 Mythos 5 保持。网络安全分类器比 Fable 5 宽松约 85%——可用于源码级漏洞发现,仍屏蔽二进制漏洞扫描、渗透测试、exploit 生成等。

易被忽略:默认不强制数据留存

Opus 5 与历代 Opus 一致,默认访问不强制数据留存;Fable 5 / Mythos 5 需接受 30 天数据留存政策。合规敏感场景下,这可能是选 Opus 5 而非 Fable 5 的关键理由。

维度Claude Opus 5Claude Fable 5
发布日期2026-07-242026-06-09(7/1 公众可用)
输入 / 输出定价$5 / $25 per 1M tokens约 $10 / $50 per 1M tokens
CursorBench 3.2(max)与 Fable 5 峰值差 0.5%峰值基准
Claude Max 默认是(发布日起)
数据留存默认不强制需接受 30 天留存
双用途前沿(网安/生物)故意未刷前沿更强(Mythos 5 受限最强)

Kimi K3「蒸馏门」:白宫下场,专家吐槽时间线,Greenblatt 挖出新证据

若 Opus 5 是「正常发新品」,Kimi K3 的剧情则复杂得多。月之暗面 7 月 16 日发布 K3(2.8T 参数、1M 上下文、稀疏 MoE),官方自称整体能力仅次于 Fable 5 与 GPT-5.6 Sol;完整权重承诺 7 月 27 日 放出——争议爆发时外部尚无法独立验证。

白宫突然下场

2026 年 7 月 22–23 日,白宫科技政策办公室(OSTP)主任 Michael Kratsios 在 X 发文,指控月之暗面通过「大规模、隐蔽的产业级蒸馏(distillation)」窃取 Anthropic Fable 模型能力,并提及涉嫌使用未获出口许可的 Nvidia GB300 芯片(可能经泰国服务器间接获取)。财政部长 Scott Bessent 附和称在「很多中国模型上发现了美国大模型的水印」,但未说明水印具体指什么。

这并非空穴来风:2026 年 2 月 Anthropic 已公开指控月之暗面、DeepSeek、MiniMax「产业级蒸馏攻击」,称识别出月之暗面超过 340 万次异常 API 交互,「明显偏离正常使用模式」,并称已通过请求元数据追踪到部分行为与月之暗面高层相关。月之暗面从未正面确认或否认。

独立专家:时间根本不够

TechCrunch(7/23)采访多位研究者,普遍对「两周内蒸馏出 K3」存疑。Snorkel AI 联合创始人 Braden Hancock:

「Fable 从 7 月 1 日才开始公开可用,你不可能在两周内蒸馏出这么多数据、训练完模型还发布出来。」

Allen Institute for AI 研究员 Nathan Lambert 认为,随着中国模型逼近前沿,简单监督微调式蒸馏边际收益变小,真正拉开差距的是更耗时的强化学习——若蒸馏真这么好用,追赶者早该靠蒸馏追平 GLM 或 K3,但事实并非如此。

Elon Musk 曾在庭审中承认 xAI 训练 Grok 时蒸馏过 OpenAI 模型,并称行业常见——「蒸馏」本身不违法,核心在于「正常技术借鉴」与「隐蔽工业级窃取」的边界如何界定。

最硬核证据:K3 会「自称是 Claude」

Redwood Research 首席科学家 Ryan Greenblatt(7/24 左右,GitHub:rgreenblatt/which_claude_is_k3)对多模型身份自认行为做交叉熵对比,发现:

  • Kimi K3 异常高频自称 Claude,甚至吐出 Claude 官方内部部署 ID,如 claude-opus-4-5-20250929claude-sonnet-4-5-20250929
  • 真正的 Claude Sonnet 4.5 只会说「我是 Claude Sonnet 4.5」;Opus 4.5 往往不报或报错版本号——教师模型自己都没有 K3 报得准
  • K3 自称版本锁定在「Claude 4.5 世代」(2025 年末),而非当前 Fable/Mythos;上一代 K2 信号指向更早的 Claude Sonnet 4——呈现「逐代追新」规律。

Greenblatt 解读:更可能指向训练数据混入带部署元数据标注的 Claude 数据(API 日志或打标合成数据),是一种更具体、更难用「模仿对话风格」解释的蒸馏形式。但他强调:这些发现不能直接证明蒸馏发生——身份混淆也可能来自数据污染、系统提示泄露或公开数据集合成样本。

社区态度:吃瓜之外,更在乎能不能用、值不值

Reddit r/LocalLLaMA 上三方声音:欢呼开源与闭源差距缩短到「天」而非「月」;调侃 2.8T 几乎没人本地跑;务实派认为 K3 卖点是低价 + 少拒答,而非「打败 Fable 5」。7 月 27 日权重放出前,架构与跑分仍无法外部独立验证。

日期事件
2026-02Anthropic 首次公开指控月之暗面/DeepSeek/MiniMax「产业级蒸馏攻击」(340 万+ 异常交互)
2026-07-01Claude Fable 5 面向公众开放
2026-07-16Kimi K3 API/产品正式发布(2.8T,完整权重待 7/27)
2026-07-22/23白宫 OSTP 主任 Kratsios 公开指控蒸馏 + 违规芯片
2026-07-23TechCrunch 刊发专家质疑蒸馏时间线
2026-07-24Claude Opus 5 发布;Greenblatt 发布「K3 自称 Claude」统计
2026-07-27(计划)Kimi K3 完整权重开源,外部可独立验证

Claude Opus 5 vs Kimi K3:本周事件后的快速决策矩阵

选型维度倾向 Claude Opus 5倾向 Kimi K3(待 7/27 验证)
合规 / 数据留存默认不强制留存;Anthropic 企业链路成熟开源权重 + 低价,但蒸馏指控与供应链风险未澄清
Agent / 编程CursorBench、AutomationBench、OSWorld 官方数据领先Program Bench、SWE Marathon 自报强,外部复现待权重
成本半价 Fable 级能力,$5/$25官方定位大幅低于 Fable 5 / GPT-5.6 Sol
审查 / 拒答对齐最强一代,双用途仍有限制社区认为「少拒答」是真实卖点之一
可验证性已全面可用(API / Bedrock / Vertex 等)7/27 前架构与跑分无法独立验证

六步 Runbook:本周两大事件后如何落地选型与 Agent 部署

  1. 明确场景优先级:若 Agent 编程、自动化与合规留存是核心,优先评估 Opus 5(及编程助手选型矩阵中的组合栈);若极限成本 + 开源可控,标记 7/27 后复测 K3。
  2. 核对数据留存与合规条款:企业场景对比 Opus 5(默认不强制留存)与 Fable 5 / Mythos 5(30 天留存 opt-in);涉及跨境或政企项目单独做法务评审。
  3. 用 Effort 档位做成本探测:Opus 5 Thinking 默认开启——对 CursorBench 类任务可先用 high/max 测质量,再用较低 effort 测 Zapier 类自动化是否仍达标,避免 token 浪费。
  4. 对 K3 保持「证据分级」:政治指控(白宫)→ 时间线反驳(专家)→ 技术间接证据(Greenblatt)分三层记录,7/27 权重放出后跑 identity prompt 与 benchmark 复现。
  5. 配置多模型 Gateway:在专用节点部署 OpenClaw 或 Kimi Code + OpenRouter 路由,避免笔记本睡眠中断长会话;API Key 与 provider fallback 分环境隔离。
  6. 7/27 后追更验证:权重公开后对比 GPQA-Diamond、BrowseComp 与「你是谁」identity 测试,更新内部模型路由表并归档决策依据。

三条应写进技术评审的硬核数据

  • Opus 5 / Fable 5 性价比剪刀差:CursorBench 3.2 max effort 峰值相差 0.5%,token 单价约为 Fable 5 的 50%($5/$25 vs 约 $10/$50 per 1M)——Anthropic 用「半价逼近旗舰」直接回应市场性价比诉求。
  • ARC-AGI 3 三倍 gap:Opus 5 在「没见过的新问题」评测得分为次优模型的 3 倍,OSWorld 2.0 用 <1/3 Fable 成本超 Fable 最佳——Agent 泛化与计算机操作是本次发布最亮眼的量化信号。
  • K3 身份混淆统计:Greenblatt 交叉熵分析显示 K3 在被问「你是谁」时 disproportionately 输出 Claude 内部部署 ID(如 claude-opus-4-5-20250929),且版本锁定 Claude 4.5 世代而非 Fable/Mythos——这是蒸馏争议中迄今最具技术含金量、竞争最小的英文长尾角度Why does Kimi K3 say it's Claude)。

两件事放在一起看:性价比才是主战场

Opus 5 用「半价逼近旗舰」回应市场对性价比的诉求;Kimi K3 用「开源 + 低价 + 少限制」冲击市场;围绕 K3 的争议,本质是各家在性价比战争里对「你的低价是靠技术优化还是靠白嫖别人模型」的公开摊牌。

对普通开发者与企业:先看场景,再看立场。合规、数据留存、供应链敏感 → Opus 5 性价比很高;极限成本与开源可控 → 等 7/27 权重后再实测 K3。

若在本地笔记本上切换 Opus 5 / K3 / 多 provider Gateway,合盖睡眠、网络抖动与密钥散落是三大隐性成本——长会话 Agent 与自动化任务需要专用 7×24 在线节点。MACCOME Mac 云主机提供真实 macOS、SSH 交接与环境隔离,让 Claude Code、OpenClaw 与多模型路由在专用实例上稳定运行。方案与定价见Mac mini 云租用价格

数据来源:Anthropic 官方发布(anthropic.com/news/claude-opus-5)、Moonshot/Kimi 技术博客、TechCrunch、Ryan Greenblatt GitHub(rgreenblatt/which_claude_is_k3)、CNBC / The Verge。基准为各厂商自报或第三方统计,截止 2026 年 7 月 25 日。

常见问题

Claude Opus 5 比 Claude Fable 5 便宜多少?

价格完全相同的 token 单价下,Opus 5 约为 Fable 5 的一半(Fable 5 约 $10/$50 每百万输入/输出 token,Opus 5 维持 $5/$25);CursorBench 3.2 峰值与 Fable 5 相差不到 1%。

Claude Opus 5 现在是 Claude Max 的默认模型吗?

是的,2026 年 7 月 24 日发布当天起 Opus 5 成为 Claude Max 默认模型,也是 Claude Pro 用户可用的最强版本。

Kimi K3 真的蒸馏了 Claude 吗?

截至本文发布仍属争议、未被最终证实。白宫指控缺乏公开证据;独立专家从时间线认为两周内深度蒸馏不现实;Ryan Greenblatt 发现的「K3 自称是 Claude 并吐出内部版本号」是目前最具技术含量的间接证据。详见Kimi K3 深度评测

Kimi K3 的完整权重什么时候能下载?

官方承诺 2026 年 7 月 27 日;本文发布时尚未放出,外部研究者尚无法完全独立验证架构与跑分。

为什么 Kimi K3 会说自己是 Claude?

Greenblatt 的统计分析显示 K3 在被问身份时异常高频输出 Claude 及内部部署 ID(如 claude-opus-4-5-20250929),比真 Claude 自己报得还准——可能指向训练数据混入带元数据标注的 Claude 样本,但不能单独证明蒸馏;也可能是数据污染或提示泄露。

如何在生产环境 7×24 运行 Opus 5 / K3 混合 Agent?

推荐在专用 Mac 云主机部署 Gateway 与多 provider 路由,避免笔记本睡眠中断。查看MACCOME Mac 云租用方案获取节点配置与定价。