阿里 Qwen3.8-Max 發布:2.4 萬億參數衝進 Arena 全球前五,「開源」標籤比權重先到

約 16 分鐘閱讀 · MACCOME · 最後更新:2026 年 8 月 4 日

適用讀者:正在評估國產旗艦大模型 API、關注 Agent 成本與開源可信度的開發者與技術負責人。2026 年 8 月 3 日,阿里巴巴正式發布 Qwen3.8-Max(2.4 萬億總參數 / 950 億啟用、1M 上下文),同步上線 Agent 產品「千問辦公」,Arena 文字競技場排名第 5——但所有跑分均為阿里自測,官網已標「Open-Source」而權重尚未落地。你將獲得:完整時間線、核心資料表、與 Kimi K3 / DeepSeek V4 對比矩陣、開源爭議拆解、六步選型 Runbook 與 FAQ。結構:痛點 → 時間線 → 架構解讀 → 競品對比 → 爭議點 → Runbook → 收束轉化。Kimi K3 背景見Kimi K3 全面開源

bolt

TL;DR — 30 秒結論

  • 8/3 GA:Qwen3.8-Max API 全量可用,定價 $2/$6 per 1M(輸入/輸出),低於 Claude Opus 5 與 Fable 5;「千問辦公」對標騰訊 WorkBuddy 與 Kimi Work。
  • Arena 第 5:文字競技場 1496 分(Preliminary),前 8 名中唯一非 Anthropic 模型;視覺競技場第 2,僅次於 Fable 5。
  • 開源未到:官網已標 Open-Source,Hugging Face / ModelScope 尚無儲存庫,承諾「下週」(約 8/10)放出 Qwen3.8-Max 與 Qwen3.8-27B 權重。
  • 競品檔位:獨立盲測中 Kimi K3 83 分 vs Qwen3.8-Max 預覽版 80 分——同檔互有勝負,非全面碾壓。

六大痛點:Qwen3.8-Max 發布週,開發者最容易踩的坑

  1. 把「Open-Source」標籤當已開源:qwen.ai 官網 GA 當天即標註開源,但截至 8/4 無 Hugging Face 儲存庫、無授權條款——標籤描述的是意圖,不是已交付的權重檔案。
  2. 把阿里自測跑分當第三方定論:PaperBench 93.0、OSWorld 86.1 等均來自阿里自建測試框架;Artificial Analysis 等平台尚未對正式版復現。
  3. 忽視啟用參數披露時間差:預覽版(7/19)未公布啟用參數量,GA 才補充 950 億——透明度不足是多家獨立評測機構 7 月批評焦點。
  4. 用總參數 2.4T 估算本地部署成本:MoE 架構下推理成本跟蹤啟用量(950 億),API 呼叫接近千億級模型;完整版本地部署仍需多節點資料中心。
  5. 忽略預覽期生產禁令:7/19 預覽版 ToS 明確禁止自動化生產環境呼叫,且未提供 model card——不宜在未復測 GA 前直接遷移生產流量。
  6. 在筆電上跑長程 Agent 評測:16 天自主編碼、500+ 步晶片設計等 showcase 需要 7×24 線上節點,合蓋即斷鏈。

時間線:從預覽版到 GA,兩週節奏極快

  • 7/16:月之暗面發布 Kimi K3(2.8T 參數,16/896 專家啟用),主打獨立評測與技術報告。
  • 7/19:Qwen3.8-Max 預覽版上線 Token Plan / Qoder / QoderWork,定價為正式價 10%,未公布啟用參數與跑分表。
  • 7/27:Kimi K3 按承諾開源權重,上線 Hugging Face。
  • 7/31:DeepSeek V4-Flash 正式版發布,9 項智能體/程式碼基準超 V4-Pro 預覽版,不靠堆參數。
  • 8/3:Qwen3.8-Max GA,發布完整跑分表,「千問辦公」同步上線;阿里港股漲約 7%、美股漲約 4.5%。
  • 預計 8/10 前後:Qwen3.8-Max 與 Qwen3.8-27B 權重計畫登陸 Hugging Face / ModelScope,具體日期與協定待定。
項目Qwen3.8-Max
發布日期2026-08-03(GA)
總參數 / 啟用參數2.4 萬億 / 950 億
架構基於 Qwen3.5 的稀疏 MoE + 混合注意力
上下文視窗100 萬 token(思考模式約 98.3 萬,輸出上限 13.1 萬)
API 定價(國際)輸入 $2 / 輸出 $6 per 1M tokens
Arena 文字(8/1 快照)第 5 名,1496 分(Preliminary)
PaperBench(阿里自測)93.0(較上代 +28.2)
SWE-bench Pro(阿里自測)67.7(落後 Fable 5 的 80.0)
權重開源承諾「下週」,截至發稿未上線

深度拆解:2.4 萬億參數背後,阿里想解決什麼問題

為什麼是 MoE + 混合注意力,而不是單純堆參數?

稀疏 MoE 把總參數推到 2.4 萬億,實際啟用控制在 950 億——推理成本更接近千億級模型,而非呼叫全部 2.4T。這也是 API 定價能壓到 $2/$6,明顯低於 Claude Opus 5($5/$25)與 Fable 5($10/$50)的架構基礎:用效率換價格競爭力

reasoning_effort 三檔:成本可控的標配設計

提供 low / medium / xhigh(預設 xhigh)三檔推理強度,可透過 enable_thinking 或 Anthropic 相容介面的 reasoning.effort 欄位呼叫——按任務複雜度在速度與深度間取捨。

長程自主任務:賣點強,但驗證方式需審慎

案例包括 16 天無人工介入的自主編碼、500+ 步晶片設計最佳化,以及自建 RecreationBench(黑盒環境下僅憑互動與視覺回饋還原真實應用)。部分過程記錄在 GitHub qwen-code-dev-bot/oh-my-cli,但並非完整可復現的第三方稽核。

生態卡位:模型到 Agent 產品一體化

同步接入「千問辦公」,API 相容 OpenAI 與 Anthropic 協定,可直接對接 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等工具鏈——降低遷移成本,搶占 Agent 生態入口。

模型廠商總/啟用參數定價(in/out per 1M)權重開源獨立第三方評測
Qwen3.8-Max阿里巴巴2.4T / 950 億$2 / $6未開源(承諾中)暫無
Kimi K3月之暗面2.8T / ~500 億$3 / $15已開源(7/27)Artificial Analysis ≈57.11
DeepSeek V4-FlashDeepSeek同 V4-Pro未完整公開已開源9 項基準超 V4-Pro
Claude Fable 5Anthropic未公開$10 / $50閉源Arena 文字第 1
Claude Opus 5Anthropic未公開$5 / $25閉源Arena 前列

爭議點:「開源」標籤掛得比權重早

  1. 官網已標 Open-Source,權重未發布:GA 當天打標,Hugging Face / ModelScope 無儲存庫,僅「下週」模糊承諾。
  2. 所有跑分均來自阿里自建框架:含 QwenSWEBench、RecreationBench 等內部基準;中立平台尚未復現 GA 資料。
  3. 腳註暗指競品 fallback:對比表註明「Fable 5 結果可能涉及 fallback」,但未公開同等方法論細節。
  4. 預覽期透明度缺口:7/19 預覽版禁止生產自動化呼叫,無 model card 與安全評估——多家機構建議先業務場景 A/B 測試。

這不代表 Qwen3.8-Max 效能不行——唯一獨立盲測(269 個檔案的真實架構任務)顯示 Kimi K3 83 分、Qwen3.8-Max 預覽版 80 分,屬同檔互有勝負。但「穩壓 GPT-5.6 Sol 和 Fable 5」類結論,目前主要還是阿里的一面之詞,需等權重落地與第三方復現。

行業背景:參數競賽與架構效率競賽並行

  • 萬億參數擴產年:DeepSeek V4-Pro(1.6T)→ Qwen3.8-Max(2.4T)→ Kimi K3(2.8T),但 V4-Flash 證明不靠堆參數也能大幅提升 Agent 能力。
  • 阿里罕見回歸開源:首次承諾開源 Max 級權重,與 Kimi K3、DeepSeek 構成國產頭部「開放權重」格局。
  • 消費端落地:千問已透過Apple Intelligence 中國版進入數億 iPhone 系統級 AI——商業化半徑遠超 API 呼叫。
  • 中美監管對照:8/4 白宮召集 OpenAI、Anthropic、Google、Meta 商討 Agent 網路安全測試框架——與國產模型加速開源形成鮮明反差。

六步 Runbook:Qwen3.8-Max 發布後的落地選型指南

  1. 區分 API 試用與生產遷移:GA 前預覽版禁止生產自動化;GA 後先用非關鍵流量 A/B 對比現有主力模型(如 Kimi K3 或 Claude Opus 5)。
  2. 按任務選 reasoning_effort:簡單任務用 low/medium 控成本;複雜 Agent 與長程編碼用 xhigh,記錄 token 消耗基線。
  3. 核對介面相容性:若已有 Claude Code / OpenClaw 堆疊,優先測 Anthropic 相容端點;確認 reasoning.effort 與快取策略(隱式 $0.25、顯式讀取 $0.17 per 1M)。
  4. 建立「證據分級」檔案:阿里自測 → Arena Preliminary → 獨立盲測分三層記錄,8/10 權重落地後跑 identity 與 benchmark 復現。
  5. 長程 Agent 上專用節點:在 Mac 雲主機部署 OpenClaw Gateway,對接 Qwen3.8-Max API,避免筆電睡眠中斷 16 天級自主任務評測。
  6. 8/10 後追更開源狀態:確認 Hugging Face 儲存庫、授權條款與 Qwen3.8-27B 精簡版是否滿足本地/私有化需求,更新內部模型路由表。

三條應寫進技術評審的硬核資料

  • 定價剪刀差:Qwen3.8-Max API $2/$6 per 1M,約為 Claude Opus 5($5/$25)輸入成本的 40%、Fable 5($10/$50)的 20%——MoE 950 億啟用量是價格競爭力的架構基礎。
  • Arena 文字第 5 / 視覺第 2:1496 分(Preliminary)為前 8 名中唯一非 Anthropic 模型;視覺競技場僅次於 Fable 5——但兩項排名均標註初步,非最終定論。
  • 獨立盲測接近平局:同一組 269 檔案架構任務,Kimi K3 83 分 vs Qwen3.8-Max 預覽版 80 分——差距 3 分,屬同檔競爭而非碾壓關係。

收束:先驗證,再遷移;Agent 需要穩定節點

Qwen3.8-Max 的 GA 標誌著阿里重新站上前沿模型敘事中心:2.4T MoE、Arena 前五、千問辦公一體化——但「開源」標籤超前於權重交付、跑分尚未經第三方復現,理性選型應先 API 試用、再證據分級、最後生產遷移

若在本地筆電對接 Qwen3.8-Max + OpenClaw + 多模型 fallback,合蓋睡眠、網路抖動與金鑰散落是三大隱性成本——長程自主 Agent 與 7×24 Gateway 需要專用線上節點。筆電合蓋即斷鏈、多 provider 路由在弱網環境下頻繁 429 降級,長期穩定性不足;純 API 呼叫雖省去本地算力,卻無法支撐需要 macOS 原生工具鏈與持久化狀態的 Agent 評測場景。對於更穩定、更適合 AI Agent 自動化的生產環境,MACCOME 的 Mac 雲主機提供真實 macOS、SSH 交接與環境隔離,讓 OpenClaw、Qoder CLI 與 Qwen3.8-Max 路由在專用執行個體上穩定執行。方案與定價見Mac mini 雲端租用價格

資料來源:阿里雲官方公告、Arena.ai 公開排行榜(2026-08-01 快照)、獨立分析(Apidog、TechNode、SiliconANGLE 等)。跑分標註「阿里自測」者來自官方發布材料,發布前請核實最新開源時間與第三方復現結果。

常見問題

Qwen3.8-Max 現在能直接用嗎?開源了沒有?

API 已可透過 QwenCloud 呼叫,相容 OpenAI 與 Anthropic 協定。權重尚未開源,Hugging Face / ModelScope 預計 8/10 前後公布,以官方公告為準。

Qwen3.8-Max 和 Kimi K3 到底誰更強?

暫無權威統一評測。獨立盲測顯示兩者接近(K3 83 分、Qwen 預覽版 80 分)。K3 優勢是已開源並有第三方資料;Qwen3.8-Max 優勢是更低 API 價與更全面多模態。詳見Kimi K3 深度評測

2.4 萬億參數是不是普通開發者用不起?

API 呼叫跟蹤 950 億啟用參數,成本接近千億級模型。完整版本地部署需多節點資料中心;更現實的選擇是等待 Qwen3.8-27B 精簡版開源。

阿里公布的跑分能信嗎?

可作參考,不能當定論。均為阿里自建框架,中立平台尚未復現 GA 資料。建議關注後續獨立評測或在自己業務場景做 A/B 測試。

如何在生產環境 7×24 執行 Qwen3.8-Max Agent?

建議在專用 Mac 雲主機部署 Gateway 與多 provider 路由。查看MACCOME Mac 雲租用方案取得節點配置與定價。