ホーム
›
ブログ
›
Qwen3.8-Max リリース解説
約 16 分で読了
·
MACCOME
·
最終更新:2026 年 8 月 4 日
対象読者: 国産フラッグシップ LLM API の選定、Agent コスト、オープンソースの信頼性を検討している開発者と技術責任者の方。2026 年 8 月 3 日、Alibaba は Qwen3.8-Max (総パラメータ 2.4 兆 / アクティブ 950 億、100 万 token コンテキスト)を正式 GA し、Agent 製品「千問办公(Qwen Office)」を同時ローンチしました。Arena テキスト競技場では第 5 位ですが、すべてのスコアは Alibaba 自社測定 であり、公式サイトには「Open-Source」表示がある一方、ウェイトは未公開です。本記事で得られる内容: 完全タイムライン、核心データ表、Kimi K3 / DeepSeek V4 との比較マトリクス、オープンソース論争の整理、6 ステップ選定 Runbook、FAQ。構成: 痛点 → タイムライン → アーキテクチャ解説 → 競合比較 → 論争点 → Runbook → まとめ。Kimi K3 の背景はKimi K3 完全オープンウェイト公開 をご参照ください。
bolt
TL;DR — 30 秒で把握
8/3 GA: Qwen3.8-Max API が全面利用可能。料金は $2/$6 per 1M(入力/出力)で Claude Opus 5 や Fable 5 より低い。「千問办公」は Tencent WorkBuddy や Kimi Work に対抗する位置づけです。
Arena 第 5 位: テキスト競技場 1496 点(Preliminary)。上位 8 名中唯一の非 Anthropic モデル。ビジュアル競技場は第 2 位で Fable 5 に次ぎます。
オープンソース未到着: 公式サイトに Open-Source 表示あり。Hugging Face / ModelScope にはリポジトリなし。「来週」(約 8/10)に Qwen3.8-Max と Qwen3.8-27B のウェイト公開を約束。
競合同格: 独立ブラインドテストでは Kimi K3 83 点 vs Qwen3.8-Max プレビュー版 80 点。互角の勝負であり、全面優位ではありません。
6 つの痛点:Qwen3.8-Max リリース週に開発者が陥りやすい落とし穴
「Open-Source」ラベルを公開済みと誤認する: qwen.ai 公式サイトは GA 当日からオープンソース表示ですが、8/4 時点で Hugging Face リポジトリもライセンス条項もありません。ラベルは意図を示すものであり、配布済みウェイトファイルではありません。
Alibaba 自社ベンチマークを第三者結論と混同する: PaperBench 93.0、OSWorld 86.1 などはすべて Alibaba 独自テストフレームワークによるものです。Artificial Analysis 等のプラットフォームは正式版を未再現です。
アクティブパラメータ開示のタイムラグを見落とす: プレビュー版(7/19)はアクティブパラメータを未公開。GA で初めて 950 億と開示されました。透明性不足は 7 月に複数の独立評価機関が批判した焦点です。
総パラメータ 2.4T でローカルデプロイコストを見積もる: MoE アーキテクチャでは推論コストはアクティブ量(950 億)に連動します。API 呼び出しは 1000 億級モデルに近く、フルウェイトのローカルデプロイには依然としてマルチノードデータセンターが必要です。
プレビュー期の本番利用禁止を無視する: 7/19 プレビュー版 ToS は自動化された本番環境呼び出しを明示的に禁止し、model card も未提供です。GA 再テスト前に本番トラフィックを直接移行すべきではありません。
ノート PC で長期 Agent ベンチマークを実行する: 16 日間の自律コーディング、500 ステップ超のチップ設計などのショーケースには 7×24 オンラインノードが必要です。フタを閉じれば接続が切れます。
タイムライン:プレビューから GA まで、2 週間の急速な展開
7/16: 月之暗面(Moonshot AI)が Kimi K3 をリリース(2.8T パラメータ、16/896 エキスパート活性化)。独立評価と技術レポートを前面に打ち出しました。
7/19: Qwen3.8-Max プレビュー版が Token Plan / Qoder / QoderWork に登場。正式価格の 10% で提供。アクティブパラメータとスコア表は未公開。
7/27: Kimi K3 が約束どおりウェイトを公開し、Hugging Face に登場。
7/31: DeepSeek V4-Flash 正式版リリース。9 項目の Agent/コードベンチマークで V4-Pro プレビュー版を上回り、パラメータ増加に頼らない成果です。
8/3: Qwen3.8-Max GA。完全スコア表を公開し「千問办公」を同時ローンチ。Alibaba 株は香港で約 7%、米国で約 4.5% 上昇。
8/10 前後(予定): Qwen3.8-Max と Qwen3.8-27B のウェイトが Hugging Face / ModelScope に登場予定。具体的な日付とライセンスは未定。
項目 Qwen3.8-Max
リリース日 2026-08-03(GA)
総パラメータ / アクティブ 2.4 兆 / 950 億
アーキテクチャ Qwen3.5 ベースの疎 MoE + ハイブリッドアテンション
コンテキストウィンドウ 100 万 token(思考モード約 98.3 万、出力上限 13.1 万)
API 料金(国際) 入力 $2 / 出力 $6 per 1M tokens
Arena テキスト(8/1 スナップショット) 第 5 位、1496 点(Preliminary)
PaperBench(Alibaba 自社) 93.0(前世代比 +28.2)
SWE-bench Pro(Alibaba 自社) 67.7(Fable 5 の 80.0 に劣る)
ウェイト公開 「来週」と約束、執筆時点では未公開
深度解説:2.4 兆パラメータの裏で Alibaba が解決しようとしている課題
なぜ MoE + ハイブリッドアテンションなのか、単純なパラメータ増加ではない理由
疎 MoE は総パラメータを 2.4 兆まで押し上げながら、実際のアクティブを 950 億に抑えます。推論コストは 1000 億級モデルに近く、2.4T 全体を呼び出すわけではありません。これが API 料金を $2/$6 に抑え、Claude Opus 5($5/$25)や Fable 5($10/$50)を大きく下回るアーキテクチャ基盤です。効率で価格競争力を獲得する 設計です。
reasoning_effort 3 段階:コスト管理の標準設計
low / medium / xhigh(デフォルト xhigh)の 3 段階推論強度を提供。enable_thinking または Anthropic 互換 API の reasoning.effort フィールドで呼び出せます。タスクの複雑さに応じて速度と深度を切り替えられます。
長期自律タスク:訴求力は高いが、検証方法は慎重に
16 日間の無人介入自律コーディング、500 ステップ超のチップ設計最適化、独自 RecreationBench(ブラックボックス環境でインタラクションと視覚フィードバックのみから実アプリを再現)などの事例があります。一部のプロセスは GitHub qwen-code-dev-bot/oh-my-cli に記録されていますが、完全に再現可能な第三者監査ではありません。
エコシステム配置:モデルから Agent 製品まで一体化
「千問办公」への同時接続、OpenAI / Anthropic プロトコル互換 API により、Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw などのツールチェーンに直接接続可能です。移行コストを下げ、Agent エコシステムの入口を確保します。
モデル ベンダー 総/アクティブ 料金(in/out per 1M) ウェイト公開 独立第三者評価
Qwen3.8-Max Alibaba 2.4T / 950 億 $2 / $6 未公開(約束中) なし
Kimi K3 月之暗面 2.8T / 約 500 億 $3 / $15 公開済み(7/27) Artificial Analysis ≈57.11
DeepSeek V4-Flash DeepSeek V4-Pro 同等 未完全公開 公開済み 9 項目で V4-Pro 超
Claude Fable 5 Anthropic 非公開 $10 / $50 クローズド Arena テキスト第 1
Claude Opus 5 Anthropic 非公開 $5 / $25 クローズド Arena 上位
論争点:「オープンソース」ラベルがウェイトより先に付いた
公式サイトに Open-Source 表示、ウェイト未公開: GA 当日にラベル付与。Hugging Face / ModelScope にリポジトリなし。「来週」という曖昧な約束のみ。
すべてのスコアが Alibaba 独自フレームワーク由来: QwenSWEBench、RecreationBench など内部ベンチマークを含みます。中立プラットフォームは GA データを未再現です。
脚注が競合の fallback を示唆: 比較表に「Fable 5 の結果は fallback を含む可能性あり」と記載。同等の方法論詳細は未公開です。
プレビュー期の透明性ギャップ: 7/19 プレビュー版は本番自動化呼び出しを禁止し、model card と安全評価なし。複数機関がビジネスシーンでの A/B テストを推奨しました。
これは Qwen3.8-Max の性能が低いという意味ではありません。唯一の独立ブラインドテスト(269 ファイルの実アーキテクチャタスク)では Kimi K3 83 点、Qwen3.8-Max プレビュー版 80 点で互角です。ただし「GPT-5.6 Sol や Fable 5 を安定して上回る」という結論は、現時点では主に Alibaba 側の主張であり、ウェイト公開と第三者再現を待つ必要があります。
業界背景:パラメータ競争とアーキテクチャ効率競争の並行
兆パラメータ拡大の年: DeepSeek V4-Pro(1.6T)→ Qwen3.8-Max(2.4T)→ Kimi K3(2.8T)。一方 V4-Flash はパラメータ増加なしでも Agent 能力を大幅向上させました。
Alibaba のオープンソース回帰: 初めて Max 級ウェイトの公開を約束。Kimi K3、DeepSeek とともに国産トップの「オープンウェイト」格局を形成しています。
コンシューマー展開: 千問はApple Intelligence 中国版 経由で数億台の iPhone システム AI に組み込まれ、API 呼び出しを超える商用半径を持ちます。
米中規制の対照: 8/4 にホワイトハウスが OpenAI、Anthropic、Google、Meta を招集し Agent サイバーセキュリティテストフレームワークを協議。国産モデルのオープンソース加速との対比が鮮明です。
6 ステップ Runbook:Qwen3.8-Max リリース後の導入選定ガイド
API 試用と本番移行を区別する: GA 前プレビュー版は本番自動化を禁止。GA 後は非クリティカルなトラフィックで A/B テストし、既存主力モデル(Kimi K3 や Claude Opus 5 等)と比較します。
タスクに応じて reasoning_effort を選択: 単純タスクは low/medium でコスト管理。複雑な Agent と長期コーディングは xhigh を使用し、token 消費のベースラインを記録します。
API 互換性を確認する: Claude Code / OpenClaw スタックがある場合は Anthropic 互換エンドポイントを優先テスト。reasoning.effort とキャッシュ戦略(暗黙 $0.25、明示読取 $0.17 per 1M)を確認します。
「証拠レベル」アーカイブを構築する: Alibaba 自社測定 → Arena Preliminary → 独立ブラインドテストの 3 層で記録。8/10 ウェイト公開後に identity と benchmark 再現を実行します。
長期 Agent は専用ノードへ: Mac クラウドホストに OpenClaw Gateway をデプロイし Qwen3.8-Max API に接続。ノート PC スリープによる 16 日級自律タスクの中断を避けます。
8/10 以降にオープンソース状況を追跡: Hugging Face リポジトリ、ライセンス、Qwen3.8-27B コンパクト版がローカル/プライベート要件を満たすか確認し、内部モデルルーティング表を更新します。
技術レビューに書くべき 3 つの核心データ
料金シザース: Qwen3.8-Max API $2/$6 per 1M は Claude Opus 5($5/$25)入力コストの 40% 、Fable 5($10/$50)の 20% 。MoE 950 億アクティブが価格競争力のアーキテクチャ基盤です。
Arena テキスト第 5 / ビジュアル第 2: 1496 点(Preliminary)は上位 8 名中唯一の非 Anthropic モデル。ビジュアル競技場は Fable 5 に次ぐ第 2 位。ただし両方 Preliminary 表示で最終結論ではありません。
独立ブラインドテストは互角: 同一 269 ファイルアーキテクチャタスクで Kimi K3 83 点 vs Qwen3.8-Max プレビュー版 80 点。3 点差は同格競争であり、圧倒的優位ではありません。
まとめ:まず検証、次に移行。Agent には安定ノードが必要
Qwen3.8-Max の GA は Alibaba が最先端モデル叙事の中心に再び立つマイルストーンです。2.4T MoE、Arena 上位、千問办公一体化。ただし「オープンソース」ラベルはウェイト配布に先行し、スコアは第三者未再現です。理性的な選定はまず API 試用、次に証拠レベル分類、最後に本番移行 です。
ローカルノート PC で Qwen3.8-Max + OpenClaw + マルチモデル fallback を接続する場合、フタ閉じスリープ、ネットワークジッター、キー散在が 3 大の隠れコストです。長期自律 Agent と 7×24 Gateway には専用オンラインノードが必要です。純 API 呼び出しはローカル算力を省けますが、macOS ネイティブツールチェーンと永続状態が必要な Agent ベンチマークには向きません。より安定した AI Agent 自動化の本番環境には、MACCOME の Mac クラウドホスト がリアル macOS、SSH 引き渡し、環境分離を提供し、OpenClaw、Qoder CLI、Qwen3.8-Max ルーティングを専用インスタンスで安定稼働させます。プランと料金はMac mini クラウドレンタル料金 をご覧ください。
データソース: Alibaba Cloud 公式発表、Arena.ai 公開ランキング(2026-08-01 スナップショット)、独立分析(Apidog、TechNode、SiliconANGLE 等)。「Alibaba 自社」と記載のスコアは公式資料由来です。最新のオープンソース時期と第三者再現結果は公開前にご確認ください。
よくある質問
Qwen3.8-Max は今すぐ使えますか?オープンソースになっていますか?
API は QwenCloud 経由で利用可能で、OpenAI および Anthropic プロトコルに対応しています。ウェイトは未公開で、Hugging Face / ModelScope への公開は 8/10 前後を予定しています。詳細は公式発表をご確認ください。
Qwen3.8-Max と Kimi K3 はどちらが強いですか?
権威ある統一ベンチマークは現時点でありません。独立ブラインドテストでは接近しています(K3 83 点、Qwen プレビュー版 80 点)。K3 の強みはオープンウェイト公開と第三者データ、Qwen3.8-Max の強みは低い API 価格とより包括的なマルチモーダルです。詳細はKimi K3 詳細レビュー をご参照ください。
2.4 兆パラメータは一般開発者には手が届きませんか?
API 呼び出しは 950 億アクティブパラメータに連動し、1000 億級モデルに近いコストです。フルウェイトのローカルデプロイにはマルチノードデータセンターが必要です。現実的な選択肢は Qwen3.8-27B コンパクト版の公開を待つことです。
Alibaba 公布のスコアは信頼できますか?
参考にはなりますが、結論としては使えません。すべて Alibaba 独自フレームワークによるもので、中立プラットフォームは GA データを未再現です。今後の独立評価、または自社ビジネスシーンでの A/B テストを推奨します。
本番環境で 7×24 Qwen3.8-Max Agent を運用するには?
専用 Mac クラウドホストに Gateway とマルチプロバイダルーティングをデプロイすることを推奨します。MACCOME Mac クラウドレンタルプラン でノード構成と料金をご確認ください。