Alibaba Qwen3.8-Max 正式リリース:2.4T パラメータで Arena 世界 5 位、「オープンソース」ラベルがウェイトより先

約 16 分で読了 · MACCOME · 最終更新:2026 年 8 月 4 日

対象読者:国産フラッグシップ LLM API の選定、Agent コスト、オープンソースの信頼性を検討している開発者と技術責任者の方。2026 年 8 月 3 日、Alibaba は Qwen3.8-Max(総パラメータ 2.4 兆 / アクティブ 950 億、100 万 token コンテキスト)を正式 GA し、Agent 製品「千問办公(Qwen Office)」を同時ローンチしました。Arena テキスト競技場では第 5 位ですが、すべてのスコアは Alibaba 自社測定であり、公式サイトには「Open-Source」表示がある一方、ウェイトは未公開です。本記事で得られる内容:完全タイムライン、核心データ表、Kimi K3 / DeepSeek V4 との比較マトリクス、オープンソース論争の整理、6 ステップ選定 Runbook、FAQ。構成:痛点 → タイムライン → アーキテクチャ解説 → 競合比較 → 論争点 → Runbook → まとめ。Kimi K3 の背景はKimi K3 完全オープンウェイト公開をご参照ください。

bolt

TL;DR — 30 秒で把握

  • 8/3 GA:Qwen3.8-Max API が全面利用可能。料金は $2/$6 per 1M(入力/出力)で Claude Opus 5 や Fable 5 より低い。「千問办公」は Tencent WorkBuddy や Kimi Work に対抗する位置づけです。
  • Arena 第 5 位:テキスト競技場 1496 点(Preliminary)。上位 8 名中唯一の非 Anthropic モデル。ビジュアル競技場は第 2 位で Fable 5 に次ぎます。
  • オープンソース未到着:公式サイトに Open-Source 表示あり。Hugging Face / ModelScope にはリポジトリなし。「来週」(約 8/10)に Qwen3.8-Max と Qwen3.8-27B のウェイト公開を約束。
  • 競合同格:独立ブラインドテストでは Kimi K3 83 点 vs Qwen3.8-Max プレビュー版 80 点。互角の勝負であり、全面優位ではありません。

6 つの痛点:Qwen3.8-Max リリース週に開発者が陥りやすい落とし穴

  1. 「Open-Source」ラベルを公開済みと誤認する:qwen.ai 公式サイトは GA 当日からオープンソース表示ですが、8/4 時点で Hugging Face リポジトリもライセンス条項もありません。ラベルは意図を示すものであり、配布済みウェイトファイルではありません。
  2. Alibaba 自社ベンチマークを第三者結論と混同する:PaperBench 93.0、OSWorld 86.1 などはすべて Alibaba 独自テストフレームワークによるものです。Artificial Analysis 等のプラットフォームは正式版を未再現です。
  3. アクティブパラメータ開示のタイムラグを見落とす:プレビュー版(7/19)はアクティブパラメータを未公開。GA で初めて 950 億と開示されました。透明性不足は 7 月に複数の独立評価機関が批判した焦点です。
  4. 総パラメータ 2.4T でローカルデプロイコストを見積もる:MoE アーキテクチャでは推論コストはアクティブ量(950 億)に連動します。API 呼び出しは 1000 億級モデルに近く、フルウェイトのローカルデプロイには依然としてマルチノードデータセンターが必要です。
  5. プレビュー期の本番利用禁止を無視する:7/19 プレビュー版 ToS は自動化された本番環境呼び出しを明示的に禁止し、model card も未提供です。GA 再テスト前に本番トラフィックを直接移行すべきではありません。
  6. ノート PC で長期 Agent ベンチマークを実行する:16 日間の自律コーディング、500 ステップ超のチップ設計などのショーケースには 7×24 オンラインノードが必要です。フタを閉じれば接続が切れます。

タイムライン:プレビューから GA まで、2 週間の急速な展開

  • 7/16:月之暗面(Moonshot AI)が Kimi K3 をリリース(2.8T パラメータ、16/896 エキスパート活性化)。独立評価と技術レポートを前面に打ち出しました。
  • 7/19:Qwen3.8-Max プレビュー版が Token Plan / Qoder / QoderWork に登場。正式価格の 10% で提供。アクティブパラメータとスコア表は未公開。
  • 7/27:Kimi K3 が約束どおりウェイトを公開し、Hugging Face に登場。
  • 7/31:DeepSeek V4-Flash 正式版リリース。9 項目の Agent/コードベンチマークで V4-Pro プレビュー版を上回り、パラメータ増加に頼らない成果です。
  • 8/3:Qwen3.8-Max GA。完全スコア表を公開し「千問办公」を同時ローンチ。Alibaba 株は香港で約 7%、米国で約 4.5% 上昇。
  • 8/10 前後(予定):Qwen3.8-Max と Qwen3.8-27B のウェイトが Hugging Face / ModelScope に登場予定。具体的な日付とライセンスは未定。
項目Qwen3.8-Max
リリース日2026-08-03(GA)
総パラメータ / アクティブ2.4 兆 / 950 億
アーキテクチャQwen3.5 ベースの疎 MoE + ハイブリッドアテンション
コンテキストウィンドウ100 万 token(思考モード約 98.3 万、出力上限 13.1 万)
API 料金(国際)入力 $2 / 出力 $6 per 1M tokens
Arena テキスト(8/1 スナップショット)第 5 位、1496 点(Preliminary)
PaperBench(Alibaba 自社)93.0(前世代比 +28.2)
SWE-bench Pro(Alibaba 自社)67.7(Fable 5 の 80.0 に劣る)
ウェイト公開「来週」と約束、執筆時点では未公開

深度解説:2.4 兆パラメータの裏で Alibaba が解決しようとしている課題

なぜ MoE + ハイブリッドアテンションなのか、単純なパラメータ増加ではない理由

疎 MoE は総パラメータを 2.4 兆まで押し上げながら、実際のアクティブを 950 億に抑えます。推論コストは 1000 億級モデルに近く、2.4T 全体を呼び出すわけではありません。これが API 料金を $2/$6 に抑え、Claude Opus 5($5/$25)や Fable 5($10/$50)を大きく下回るアーキテクチャ基盤です。効率で価格競争力を獲得する設計です。

reasoning_effort 3 段階:コスト管理の標準設計

low / medium / xhigh(デフォルト xhigh)の 3 段階推論強度を提供。enable_thinking または Anthropic 互換 API の reasoning.effort フィールドで呼び出せます。タスクの複雑さに応じて速度と深度を切り替えられます。

長期自律タスク:訴求力は高いが、検証方法は慎重に

16 日間の無人介入自律コーディング、500 ステップ超のチップ設計最適化、独自 RecreationBench(ブラックボックス環境でインタラクションと視覚フィードバックのみから実アプリを再現)などの事例があります。一部のプロセスは GitHub qwen-code-dev-bot/oh-my-cli に記録されていますが、完全に再現可能な第三者監査ではありません。

エコシステム配置:モデルから Agent 製品まで一体化

「千問办公」への同時接続、OpenAI / Anthropic プロトコル互換 API により、Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw などのツールチェーンに直接接続可能です。移行コストを下げ、Agent エコシステムの入口を確保します。

モデルベンダー総/アクティブ料金(in/out per 1M)ウェイト公開独立第三者評価
Qwen3.8-MaxAlibaba2.4T / 950 億$2 / $6未公開(約束中)なし
Kimi K3月之暗面2.8T / 約 500 億$3 / $15公開済み(7/27)Artificial Analysis ≈57.11
DeepSeek V4-FlashDeepSeekV4-Pro 同等未完全公開公開済み9 項目で V4-Pro 超
Claude Fable 5Anthropic非公開$10 / $50クローズドArena テキスト第 1
Claude Opus 5Anthropic非公開$5 / $25クローズドArena 上位

論争点:「オープンソース」ラベルがウェイトより先に付いた

  1. 公式サイトに Open-Source 表示、ウェイト未公開:GA 当日にラベル付与。Hugging Face / ModelScope にリポジトリなし。「来週」という曖昧な約束のみ。
  2. すべてのスコアが Alibaba 独自フレームワーク由来:QwenSWEBench、RecreationBench など内部ベンチマークを含みます。中立プラットフォームは GA データを未再現です。
  3. 脚注が競合の fallback を示唆:比較表に「Fable 5 の結果は fallback を含む可能性あり」と記載。同等の方法論詳細は未公開です。
  4. プレビュー期の透明性ギャップ:7/19 プレビュー版は本番自動化呼び出しを禁止し、model card と安全評価なし。複数機関がビジネスシーンでの A/B テストを推奨しました。

これは Qwen3.8-Max の性能が低いという意味ではありません。唯一の独立ブラインドテスト(269 ファイルの実アーキテクチャタスク)では Kimi K3 83 点、Qwen3.8-Max プレビュー版 80 点で互角です。ただし「GPT-5.6 Sol や Fable 5 を安定して上回る」という結論は、現時点では主に Alibaba 側の主張であり、ウェイト公開と第三者再現を待つ必要があります。

業界背景:パラメータ競争とアーキテクチャ効率競争の並行

  • 兆パラメータ拡大の年:DeepSeek V4-Pro(1.6T)→ Qwen3.8-Max(2.4T)→ Kimi K3(2.8T)。一方 V4-Flash はパラメータ増加なしでも Agent 能力を大幅向上させました。
  • Alibaba のオープンソース回帰:初めて Max 級ウェイトの公開を約束。Kimi K3、DeepSeek とともに国産トップの「オープンウェイト」格局を形成しています。
  • コンシューマー展開:千問はApple Intelligence 中国版経由で数億台の iPhone システム AI に組み込まれ、API 呼び出しを超える商用半径を持ちます。
  • 米中規制の対照:8/4 にホワイトハウスが OpenAI、Anthropic、Google、Meta を招集し Agent サイバーセキュリティテストフレームワークを協議。国産モデルのオープンソース加速との対比が鮮明です。

6 ステップ Runbook:Qwen3.8-Max リリース後の導入選定ガイド

  1. API 試用と本番移行を区別する:GA 前プレビュー版は本番自動化を禁止。GA 後は非クリティカルなトラフィックで A/B テストし、既存主力モデル(Kimi K3 や Claude Opus 5 等)と比較します。
  2. タスクに応じて reasoning_effort を選択:単純タスクは low/medium でコスト管理。複雑な Agent と長期コーディングは xhigh を使用し、token 消費のベースラインを記録します。
  3. API 互換性を確認する:Claude Code / OpenClaw スタックがある場合は Anthropic 互換エンドポイントを優先テスト。reasoning.effort とキャッシュ戦略(暗黙 $0.25、明示読取 $0.17 per 1M)を確認します。
  4. 「証拠レベル」アーカイブを構築する:Alibaba 自社測定 → Arena Preliminary → 独立ブラインドテストの 3 層で記録。8/10 ウェイト公開後に identity と benchmark 再現を実行します。
  5. 長期 Agent は専用ノードへ:Mac クラウドホストに OpenClaw Gateway をデプロイし Qwen3.8-Max API に接続。ノート PC スリープによる 16 日級自律タスクの中断を避けます。
  6. 8/10 以降にオープンソース状況を追跡:Hugging Face リポジトリ、ライセンス、Qwen3.8-27B コンパクト版がローカル/プライベート要件を満たすか確認し、内部モデルルーティング表を更新します。

技術レビューに書くべき 3 つの核心データ

  • 料金シザース:Qwen3.8-Max API $2/$6 per 1M は Claude Opus 5($5/$25)入力コストの 40%、Fable 5($10/$50)の 20%。MoE 950 億アクティブが価格競争力のアーキテクチャ基盤です。
  • Arena テキスト第 5 / ビジュアル第 2:1496 点(Preliminary)は上位 8 名中唯一の非 Anthropic モデル。ビジュアル競技場は Fable 5 に次ぐ第 2 位。ただし両方 Preliminary 表示で最終結論ではありません。
  • 独立ブラインドテストは互角:同一 269 ファイルアーキテクチャタスクで Kimi K3 83 点 vs Qwen3.8-Max プレビュー版 80 点。3 点差は同格競争であり、圧倒的優位ではありません。

まとめ:まず検証、次に移行。Agent には安定ノードが必要

Qwen3.8-Max の GA は Alibaba が最先端モデル叙事の中心に再び立つマイルストーンです。2.4T MoE、Arena 上位、千問办公一体化。ただし「オープンソース」ラベルはウェイト配布に先行し、スコアは第三者未再現です。理性的な選定はまず API 試用、次に証拠レベル分類、最後に本番移行です。

ローカルノート PC で Qwen3.8-Max + OpenClaw + マルチモデル fallback を接続する場合、フタ閉じスリープ、ネットワークジッター、キー散在が 3 大の隠れコストです。長期自律 Agent と 7×24 Gateway には専用オンラインノードが必要です。純 API 呼び出しはローカル算力を省けますが、macOS ネイティブツールチェーンと永続状態が必要な Agent ベンチマークには向きません。より安定した AI Agent 自動化の本番環境には、MACCOME の Mac クラウドホストがリアル macOS、SSH 引き渡し、環境分離を提供し、OpenClaw、Qoder CLI、Qwen3.8-Max ルーティングを専用インスタンスで安定稼働させます。プランと料金はMac mini クラウドレンタル料金をご覧ください。

データソース:Alibaba Cloud 公式発表、Arena.ai 公開ランキング(2026-08-01 スナップショット)、独立分析(Apidog、TechNode、SiliconANGLE 等)。「Alibaba 自社」と記載のスコアは公式資料由来です。最新のオープンソース時期と第三者再現結果は公開前にご確認ください。

よくある質問

Qwen3.8-Max は今すぐ使えますか?オープンソースになっていますか?

API は QwenCloud 経由で利用可能で、OpenAI および Anthropic プロトコルに対応しています。ウェイトは未公開で、Hugging Face / ModelScope への公開は 8/10 前後を予定しています。詳細は公式発表をご確認ください。

Qwen3.8-Max と Kimi K3 はどちらが強いですか?

権威ある統一ベンチマークは現時点でありません。独立ブラインドテストでは接近しています(K3 83 点、Qwen プレビュー版 80 点)。K3 の強みはオープンウェイト公開と第三者データ、Qwen3.8-Max の強みは低い API 価格とより包括的なマルチモーダルです。詳細はKimi K3 詳細レビューをご参照ください。

2.4 兆パラメータは一般開発者には手が届きませんか?

API 呼び出しは 950 億アクティブパラメータに連動し、1000 億級モデルに近いコストです。フルウェイトのローカルデプロイにはマルチノードデータセンターが必要です。現実的な選択肢は Qwen3.8-27B コンパクト版の公開を待つことです。

Alibaba 公布のスコアは信頼できますか?

参考にはなりますが、結論としては使えません。すべて Alibaba 独自フレームワークによるもので、中立プラットフォームは GA データを未再現です。今後の独立評価、または自社ビジネスシーンでの A/B テストを推奨します。

本番環境で 7×24 Qwen3.8-Max Agent を運用するには?

専用 Mac クラウドホストに Gateway とマルチプロバイダルーティングをデプロイすることを推奨します。MACCOME Mac クラウドレンタルプランでノード構成と料金をご確認ください。