约 16 分钟阅读
·
MACCOME
·
最后更新:2026 年 8 月 4 日
适用读者:正在评估国产旗舰大模型 API、关注 Agent 成本与开源可信度的开发者与技术负责人。📌 2026 年 8 月 3 日,阿里巴巴正式发布 Qwen3.8-Max(2.4 万亿总参数 / 950 亿激活、1M 上下文),同步上线 Agent 产品「千问办公」,Arena 文本竞技场排名第 5——但所有跑分均为阿里自测,官网已标「Open-Source」而权重尚未落地。你将获得:完整时间线、核心数据表、与 Kimi K3 / DeepSeek V4 对比矩阵、开源争议拆解、六步选型 Runbook 与 FAQ。结构:痛点 → 时间线 → 架构解读 → 竞品对比 → 争议点 → Runbook → 收束转化。Kimi K3 背景见Kimi K3 全面开源。
bolt
TL;DR — 30 秒结论
- 8/3 GA:Qwen3.8-Max API 全量可用,定价 $2/$6 per 1M(输入/输出),低于 Claude Opus 5 与 Fable 5;「千问办公」对标腾讯 WorkBuddy 与 Kimi Work。
- Arena 第 5:文本竞技场 1496 分(Preliminary),前 8 名中唯一非 Anthropic 模型;视觉竞技场第 2,仅次于 Fable 5。
- 开源未到:官网已标 Open-Source,Hugging Face / ModelScope 尚无仓库,承诺「下周」(约 8/10)放出 Qwen3.8-Max 与 Qwen3.8-27B 权重。
- 竞品档位:独立盲测中 Kimi K3 83 分 vs Qwen3.8-Max 预览版 80 分——同档互有胜负,非全面碾压。
六大痛点:Qwen3.8-Max 发布周,开发者最容易踩的坑
- 把「Open-Source」标签当已开源:qwen.ai 官网 GA 当天即标注开源,但截至 8/4 无 Hugging Face 仓库、无许可证条款——标签描述的是意图,不是已交付的权重文件。
- 把阿里自测跑分当第三方定论:PaperBench 93.0、OSWorld 86.1 等均来自阿里自建测试框架;Artificial Analysis 等平台尚未对正式版复现。
- 忽视激活参数披露时间差:预览版(7/19)未公布激活参数量,GA 才补充 950 亿——透明度不足是多家独立评测机构 7 月批评焦点。
- 用总参数 2.4T 估算本地部署成本:MoE 架构下推理成本跟踪激活量(950 亿),API 调用接近千亿级模型;完整版本地部署仍需多节点数据中心。
- 忽略预览期生产禁令:7/19 预览版 ToS 明确禁止自动化生产环境调用,且未提供 model card——不宜在未复测 GA 前直接迁移生产流量。
- 在笔记本上跑长程 Agent 评测:16 天自主编码、500+ 步芯片设计等 showcase 需要 7×24 在线节点,合盖即断链。
时间线:从预览版到 GA,两周节奏极快
- 7/16:月之暗面发布 Kimi K3(2.8T 参数,16/896 专家激活),主打独立评测与技术报告。
- 7/19:Qwen3.8-Max 预览版上线 Token Plan / Qoder / QoderWork,定价为正式价 10%,未公布激活参数与跑分表。
- 7/27:Kimi K3 按承诺开源权重,上线 Hugging Face。
- 7/31:DeepSeek V4-Flash 正式版发布,9 项智能体/代码基准超 V4-Pro 预览版,不靠堆参数。
- 8/3:Qwen3.8-Max GA,发布完整跑分表,「千问办公」同步上线;阿里港股涨约 7%、美股涨约 4.5%。
- 预计 8/10 前后:Qwen3.8-Max 与 Qwen3.8-27B 权重计划登陆 Hugging Face / ModelScope,具体日期与协议待定。
| 项目 | Qwen3.8-Max |
| 发布日期 | 2026-08-03(GA) |
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 |
| 架构 | 基于 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 token(思考模式约 98.3 万,输出上限 13.1 万) |
| API 定价(国际) | 输入 $2 / 输出 $6 per 1M tokens |
| Arena 文本(8/1 快照) | 第 5 名,1496 分(Preliminary) |
| PaperBench(阿里自测) | 93.0(较上代 +28.2) |
| SWE-bench Pro(阿里自测) | 67.7(落后 Fable 5 的 80.0) |
| 权重开源 | 承诺「下周」,截至发稿未上线 |
深度拆解:2.4 万亿参数背后,阿里想解决什么问题
为什么是 MoE + 混合注意力,而不是单纯堆参数?
稀疏 MoE 把总参数推到 2.4 万亿,实际激活控制在 950 亿——推理成本更接近千亿级模型,而非调用全部 2.4T。这也是 API 定价能压到 $2/$6,明显低于 Claude Opus 5($5/$25)与 Fable 5($10/$50)的架构基础:用效率换价格竞争力。
reasoning_effort 三档:成本可控的标配设计
提供 low / medium / xhigh(默认 xhigh)三档推理强度,可通过 enable_thinking 或 Anthropic 兼容接口的 reasoning.effort 字段调用——按任务复杂度在速度与深度间取舍。
长程自主任务:卖点强,但验证方式需审慎
案例包括 16 天无人工介入的自主编码、500+ 步芯片设计优化,以及自建 RecreationBench(黑盒环境下仅凭交互与视觉反馈还原真实应用)。部分过程记录在 GitHub qwen-code-dev-bot/oh-my-cli,但并非完整可复现的第三方审计。
生态卡位:模型到 Agent 产品一体化
同步接入「千问办公」,API 兼容 OpenAI 与 Anthropic 协议,可直接对接 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等工具链——降低迁移成本,抢占 Agent 生态入口。
| 模型 | 厂商 | 总/激活参数 | 定价(in/out per 1M) | 权重开源 | 独立第三方评测 |
| Qwen3.8-Max | 阿里巴巴 | 2.4T / 950 亿 | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 月之暗面 | 2.8T / ~500 亿 | $3 / $15 | 已开源(7/27) | Artificial Analysis ≈57.11 |
| DeepSeek V4-Flash | DeepSeek | 同 V4-Pro | 未完整公开 | 已开源 | 9 项基准超 V4-Pro |
| Claude Fable 5 | Anthropic | 未公开 | $10 / $50 | 闭源 | Arena 文本第 1 |
| Claude Opus 5 | Anthropic | 未公开 | $5 / $25 | 闭源 | Arena 前列 |
争议点:「开源」标签挂得比权重早
- 官网已标 Open-Source,权重未发布:GA 当天打标,Hugging Face / ModelScope 无仓库,仅「下周」模糊承诺。
- 所有跑分均来自阿里自建框架:含 QwenSWEBench、RecreationBench 等内部基准;中立平台尚未复现 GA 数据。
- 脚注暗指竞品 fallback:对比表注明「Fable 5 结果可能涉及 fallback」,但未公开同等方法论细节。
- 预览期透明度缺口:7/19 预览版禁止生产自动化调用,无 model card 与安全评估——多家机构建议先业务场景 A/B 测试。
这不代表 Qwen3.8-Max 性能不行——唯一独立盲测(269 个文件的真实架构任务)显示 Kimi K3 83 分、Qwen3.8-Max 预览版 80 分,属同档互有胜负。但「稳压 GPT-5.6 Sol 和 Fable 5」类结论,目前主要还是阿里的一面之词,需等权重落地与第三方复现。
行业背景:参数竞赛与架构效率竞赛并行
- 万亿参数扩产年:DeepSeek V4-Pro(1.6T)→ Qwen3.8-Max(2.4T)→ Kimi K3(2.8T),但 V4-Flash 证明不靠堆参数也能大幅提升 Agent 能力。
- 阿里罕见回归开源:首次承诺开源 Max 级权重,与 Kimi K3、DeepSeek 构成国产头部「开放权重」格局。
- 消费端落地:千问已通过Apple Intelligence 中国版进入数亿 iPhone 系统级 AI——商业化半径远超 API 调用。
- 中美监管对照:8/4 白宫召集 OpenAI、Anthropic、Google、Meta 商讨 Agent 网络安全测试框架——与国产模型加速开源形成鲜明反差。
六步 Runbook:Qwen3.8-Max 发布后的落地选型指南
- 区分 API 试用与生产迁移:GA 前预览版禁止生产自动化;GA 后先用非关键流量 A/B 对比现有主力模型(如 Kimi K3 或 Claude Opus 5)。
- 按任务选 reasoning_effort:简单任务用 low/medium 控成本;复杂 Agent 与长程编码用 xhigh,记录 token 消耗基线。
- 核对接口兼容性:若已有 Claude Code / OpenClaw 栈,优先测 Anthropic 兼容端点;确认
reasoning.effort 与缓存策略(隐式 $0.25、显式读取 $0.17 per 1M)。
- 建立「证据分级」档案:阿里自测 → Arena Preliminary → 独立盲测分三层记录,8/10 权重落地后跑 identity 与 benchmark 复现。
- 长程 Agent 上专用节点:在 Mac 云主机部署 OpenClaw Gateway,对接 Qwen3.8-Max API,避免笔记本睡眠中断 16 天级自主任务评测。
- 8/10 后追更开源状态:确认 Hugging Face 仓库、许可证与 Qwen3.8-27B 精简版是否满足本地/私有化需求,更新内部模型路由表。
三条应写进技术评审的硬核数据
- 定价剪刀差:Qwen3.8-Max API $2/$6 per 1M,约为 Claude Opus 5($5/$25)输入成本的 40%、Fable 5($10/$50)的 20%——MoE 950 亿激活量是价格竞争力的架构基础。
- Arena 文本第 5 / 视觉第 2:1496 分(Preliminary)为前 8 名中唯一非 Anthropic 模型;视觉竞技场仅次于 Fable 5——但两项排名均标注初步,非最终定论。
- 独立盲测接近平局:同一组 269 文件架构任务,Kimi K3 83 分 vs Qwen3.8-Max 预览版 80 分——差距 3 分,属同档竞争而非碾压关系。
收束:先验证,再迁移;Agent 需要稳定节点
Qwen3.8-Max 的 GA 标志着阿里重新站上前沿模型叙事中心:2.4T MoE、Arena 前五、千问办公一体化——但「开源」标签超前于权重交付、跑分尚未经第三方复现,理性选型应先 API 试用、再证据分级、最后生产迁移。
若在本地笔记本对接 Qwen3.8-Max + OpenClaw + 多模型 fallback,合盖睡眠、网络抖动与密钥散落是三大隐性成本——长程自主 Agent 与 7×24 Gateway 需要专用在线节点。笔记本合盖即断链、多 provider 路由在弱网环境下频繁 429 降级,长期稳定性不足;纯 API 调用虽省去本地算力,却无法支撑需要 macOS 原生工具链与持久化状态的 Agent 评测场景。对于更稳定、更适合 AI Agent 自动化的生产环境,MACCOME 的 Mac 云主机提供真实 macOS、SSH 交接与环境隔离,让 OpenClaw、Qoder CLI 与 Qwen3.8-Max 路由在专用实例上稳定运行。方案与定价见Mac mini 云租用价格。
数据来源:阿里云官方公告、Arena.ai 公开排行榜(2026-08-01 快照)、独立分析(Apidog、TechNode、SiliconANGLE 等)。跑分标注「阿里自测」者来自官方发布材料,发布前请核实最新开源时间与第三方复现结果。
常见问题
Qwen3.8-Max 现在能直接用吗?开源了没有?
API 已可通过 QwenCloud 调用,兼容 OpenAI 与 Anthropic 协议。权重尚未开源,Hugging Face / ModelScope 预计 8/10 前后公布,以官方公告为准。
Qwen3.8-Max 和 Kimi K3 到底谁更强?
暂无权威统一评测。独立盲测显示两者接近(K3 83 分、Qwen 预览版 80 分)。K3 优势是已开源并有第三方数据;Qwen3.8-Max 优势是更低 API 价与更全面多模态。详见Kimi K3 深度评测。
2.4 万亿参数是不是普通开发者用不起?
API 调用跟踪 950 亿激活参数,成本接近千亿级模型。完整版本地部署需多节点数据中心;更现实的选择是等待 Qwen3.8-27B 精简版开源。
阿里公布的跑分能信吗?
可作参考,不能当定论。均为阿里自建框架,中立平台尚未复现 GA 数据。建议关注后续独立评测或在自己业务场景做 A/B 测试。
如何在生产环境 7×24 运行 Qwen3.8-Max Agent?
推荐在专用 Mac 云主机部署 Gateway 与多 provider 路由。查看MACCOME Mac 云租用方案获取节点配置与定价。