Qwen3.8-Max 正式版公開:
2.4兆パラメータが Arena テキスト第5位、来週ウェイト公開予定

2026 年 8 月 3 日、阿里巴巴は次世代フラッグシップ大規模言語モデル千問 Qwen3.8-Maxを正式 GA 公開し、Agent 製品「千問办公(Qwen Office)」を同時にローンチしました。総パラメータ2.4 兆(2.4T)、token あたり活性950 億(95B)100 万 tokenコンテキスト、Arena テキスト竞技场で第 5 位——上位 8 名中唯一の非 Anthropic モデルです。

本稿はAPI 選定、オープンウェイト公開時期、Agent ツールチェーン移行を検討する開発者と技術意思決定者向けです。7 月 16 日から 8 月 3 日までのタイムライン、コア仕様とベンチマーク表、MoE アーキテクチャの設計思想、Kimi K3 / DeepSeek V4 / Claude との横断比較、「オープンソース」ラベル争点を整理し、六段階導入チェックリストと FAQを提供します。読了後、「今すぐ使えるか」「ウェイトは公開されたか」「Kimi K3 とどちらが強いか」を判断できる状態を目指します。

01 二週間のタイムライン:Kimi K3 公開、Qwen プレビュー、DeepSeek 逆転、阿里 GA

GA 前に押さえるべき選定リスク:

  • 「Open-Source」表示と実体の乖離:qwen.ai は GA 当日からオープンソース表記を掲げましたが、Hugging Face と ModelScope にはリポジトリもライセンスもありません。法務・コンプライアンス判断を誤るリスクがあります。
  • ベンチマークがベンダー自社実行:PaperBench、QwenSWEBench、RecreationBench 等は阿里内部ベンチです。Artificial Analysis や Arena.ai による GA 版の独立再現は、執筆時点では未公開です。
  • プレビュー期の情報不足:7 月 19 日プレビューは活性パラメータ未公開、モデルカードなし、安全評価なし、利用規約で自動化生産環境呼び出しを禁止していました。複数の独立評価機関が本番移行を非推奨としていました。
  • 活性パラメータ開示の遅れ:Kimi K3 は約 500 億、DeepSeek V4-Pro は 490 億を早期開示しましたが、阿里はプレビュー期に一切示さず、GA で初めて 950 億を公表しました。

2026 年 7 月中下旬、国産 LLM は密集リリース期に入り、ペースは極めて速くなりました。

  • 7 月 16 日:月之暗面が Kimi K3 を公開。2.8T パラメータ(896 エキスパート中 16 活性化)。独立ベンチマークと技術レポートの透明性路線を打ち出しました。
  • 7 月 19 日:Qwen3.8-Max プレビューが Token Plan / Qoder / QoderWork 経由で先行開放。正式価格の 10% ですが、活性パラメータ未公開、ベンチ表なし、自動化生産利用禁止条項あり。
  • 7 月 27 日:Kimi K3 が約束どおり完全ウェイトを Hugging Face で公開。Attention カーネル、MoE 通信ライブラリ等の一部 Infra も同時 OSS 化しました。
  • 7 月 31 日:DeepSeek が V4-Flash 正式版を公開。パラメータ規模を増やさず、アーキテクチャと学習最適化で Agent・コード系ベンチが自社 V4-Pro プレビューを大幅に上回りました。
  • 8 月 3 日:Qwen3.8-Max が GA。完全ベンチ表と「千問办公」Agent 製品が同時ローンチ。腾讯 WorkBuddy、Moonshot Kimi Work と競合します。当日、阿里巴巴香港株は約 7%、米国株は約 4.5% 上昇しました。
  • 8 月 10 日前後(予定):Qwen3.8-Max と小型版 Qwen3.8-27B のウェイトが Hugging Face と ModelScope に公開される予定ですが、執筆時点では具体日とライセンス条項は未公表です。

「パラメータ競争」の物語は「アーキテクチャ効率競争」へ移行しています。DeepSeek V4-Flash はパラメータを増やさず自社のより大きいモデルを上回り、Qwen3.8-Max の「大容量・低活性」設計も同じ賭けです。

02 Qwen3.8-Max コア仕様とベンチマーク一覧(2026 年 8 月)

以下は阿里公式公開資料に基づきます。「阿里自測」と明記した項目は、執筆時点で第三者独立再現はありません。本番移行前は公式最新公告で再確認してください。

Qwen3.8-Max コア仕様とベンチマーク(2026 年 8 月 3 日 GA)
項目
GA 日2026 年 8 月 3 日
総パラメータ / 活性パラメータ2.4 兆 / 950 億
アーキテクチャQwen3.5 ベースのスパース MoE + ハイブリッド Attention
コンテキストウィンドウ100 万 token(思考モード約 98.3 万、最大出力 13.1 万)
入力モダリティテキスト / 画像 / 動画
API 料金(国際)入力 $2/百万 token、出力 $6/百万 token
API 料金(国内)入力 12 元/百万 token、出力 36 元/百万 token
Arena テキスト竞技场(8 月 1 日スナップショット)第 5 位、1496 点(Preliminary)。上位 8 名中唯一の非 Anthropic モデル
Arena ビジョン竞技场第 2 位。Claude Fable 5 に次ぐ
PaperBench(阿里自測)93.0(前世代比 +28.2 点)
SWE-bench Pro(阿里自測)67.7(Fable 5 の 80.0 に劣る)
ウェイト公開状態「来週公開」と約束。執筆時点では未公開

03 2.4 兆パラメータの裏側:アーキテクチャ論理と四つの透明度争点

なぜ Dense パラメータの単純積み上げではなく MoE + ハイブリッド Attention なのか? Qwen3.8-Max はスパース MoE で総パラメータを 2.4 兆にしつつ、実際の活性量を 950 億に抑えます。推論コストは 2.4T 全量呼び出しではなく、千亿級モデルに近い水準です。これが API 料金を入力 $2・出力 $6(Claude Opus 5 の $5/$25、Fable 5 の $10/$50 を大きく下回る)に抑えられる根本理由です。

reasoning_effort 三档設計はコスト制御のための機能です。low / medium / xhigh(デフォルト xhigh)の三档で推論強度を調整できます。ネイティブ API の enable_thinking パラメータ、または Anthropic 互換インターフェースの reasoning.effort フィールド経由で呼び出せます。

長期自律タスクがコア訴求ですが、検証方法には注意が必要です。 阿里の事例には、16 日間無人工介入の自律コーディングプロジェクト、500 ステップ超のチップ設計最適化、自社 RecreationBench(ブラックボックス環境で対話と視覚フィードバックのみから実アプリを再現)が含まれます。これらは阿里自社ベンチで、公開度は限定的です。GitHub の qwen-code-dev-bot/oh-my-cli に部分トレースがありますが、独立監査済み結果ではありません。

エコシステム配置: Qwen3.8-Max は「千問办公」Agent プラットフォームに同期接続され、OpenAI 互換と Anthropic 互換の両 API プロトコルに対応します。Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等の主流 Agent ツールチェーンに base URL 差し替えで接続できます。

四つの争点と透明度の痛点:

  • 「Open-Source」ラベルがウェイトに先行: 公式サイトは GA 当日からオープンソース表記を掲げましたが、Hugging Face / ModelScope に対応リポジトリ、ライセンス、確定公開日はありません。
  • ベンチマークがすべてベンダー自社フレームワーク: PaperBench、QwenSWEBench、RecreationBench 等は内部ベンチです。中立プラットフォームによる GA 版の独立再現は未公開です。
  • プレビュー版の透明性不足: 7 月 19 日プレビューは活性パラメータ、モデルカード、安全評価を公開せず、複数の独立評価機関が本番移行を非推奨としました。
  • 活性パラメータ開示の遅れ: Kimi K3 は約 500 億、DeepSeek は 490 億を早期開示。阿里はプレビュー期に一切示さず、GA で初めて 950 億を公表しました。

唯一の独立盲測(269 ファイルの実プロジェクトアーキテクチャ設計タスク)では、Kimi K3 が 83 点、Qwen3.8-Max プレビュー版が 80 点でした。差は小さく、「全面優位」ではなく「互角の勝負」です。

04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

2026 年 8 月フロンティアモデル横断比較
モデル 総パラメータ / 活性 料金(入力/出力、百万 token あたり) ウェイト公開 独立第三者ベンチ
Qwen3.8-Max2.4T / 950 億$2 / $6未公開(約束中)なし
Kimi K32.8T / 約 500 億$3 / $15公開済み(7 月 27 日)AA Intelligence Index ≈ 57.11
DeepSeek V4-FlashV4-Pro と同規模完全表未公開公開済み9 項目 Agent/コードベンチで V4-Pro 超
Claude Opus 5非公開$5 / $25クローズドArena 上位
Claude Fable 5非公開$10 / $50クローズドArena テキスト竞技场第 1 位

阿里は OpenAI 互換と Anthropic 互換の両 API を提供しています。既存プロジェクトは base URL と API キーの変更だけで接続できます。

qwen38_max_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_dashscope_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "このコードベースを分析して..."}],
    extra_body={"enable_thinking": True, "reasoning_effort": "xhigh"}
)

以下が主要な公式ソースです。リリースやページ更新後はリンクを再確認してください。

https://qwen.ai

https://help.aliyun.com/zh/model-studio

https://huggingface.co/Qwen

六段階導入ガイド(Qwen3.8-Max が自社スタックに適合するか評価):

  1. 呼び出し経路の確定: API 利用なら QwenCloud(DashScope)経由で OpenAI / Anthropic 互換プロトコルを選択します。オンプレミスが必要なら Qwen3.8-27B 小型版のウェイト公開を待つか、Kimi K3 公開済みウェイトを評価します。
  2. オープンウェイト状態の確認: 8 月 4 日時点でウェイトは未公開です。公式「Open-Source」表記をダウンロード可能なウェイトと同一視しないでください。Hugging Face / ModelScope の公式リポジトリ公告を追跡します。
  3. reasoning_effort の設定: タスク複雑度に応じ low / medium / xhigh を選択します。単純タスクは low でコスト抑制、複雑 Agent タスクは xhigh で深い推論を取得します。
  4. Agent ツールチェーンへの接続: Claude Code、Qoder CLI、OpenClaw 等で base URL と API キーを差し替え、Anthropic 互換エンドポイントで移行コストを下げます。
  5. 業務シナリオ A/B テスト: 阿里自測ベンチだけで移行判断しないでください。自社の実コードベースと Agent ワークフローで Qwen3.8-Max と Kimi K3 / DeepSeek V4 を比較します。
  6. 独立ベンチ再現の待機: Artificial Analysis、Arena.ai 等の GA 版正式再測結果を待ち、本番デフォルトルートに組み込むか判断します。

05 引用可能データ、FAQ、まとめ

引用可能な主要データ(EEAT):

  • 総パラメータ vs 活性パラメータ: Qwen3.8-Max は総 2.4 兆、token あたり活性 950 億。推論コストは 2.4T 全量呼び出しではなく千亿級 Dense モデルに近い(出典:阿里巴巴 GA 公開資料、2026-08-03)。
  • API 価格競争力: 入力 $2/百万 token、出力 $6/百万 token。Claude Opus 5($5/$25)と Fable 5($10/$50)を下回り、暗黙キャッシュヒットは $0.25/百万 token まで低減(出典:阿里 Model Studio 料金表、2026-08)。
  • 消費者向け展開: 中国市場の Apple Intelligence 生成 AI 能力は Qwen モデル(圧縮後ローカル実行)に基づき、iPhone 15 以降で端末内推論します。千問系列は数億台の iPhone のシステム級 AI エンジンに拡張されています(出典:Apple / 阿里公開情報、2026-07)。

よくある質問 FAQ:

  • Q: Qwen3.8-Max は今すぐ使えますか?オープンソースですか? A: API は QwenCloud(DashScope)経由で利用可能です。ウェイトは未公開で、8 月 10 日前後の公開が予定されていますが、具体日は公式公告を確認してください。qwen.ai の「Open-Source」表記は現時点では意図を示すものであり、公開済みアーティファクトではありません。
  • Q: Kimi K3 とどちらが強いですか? A: 権威ある統一ベンチはありません。唯一の独立盲測では Kimi K3 83 点 vs Qwen プレビュー 80 点で差は小さいです。Kimi K3 の強みは公開済みウェイトと第三者ベンチ、Qwen3.8-Max の強みは低い API 価格とより広いネイティブマルチモーダル対応です。
  • Q: 2.4 兆パラメータは個人開発者には非現実的ですか? A: API 経由なら千亿級モデルに近いコストです。完全版のローカルデプロイには多ノードデータセンターが必要です。現実的な選択肢は Qwen3.8-27B 小型版のウェイト公開を待つことです。
  • Q: 阿里公開のベンチマークは信頼できますか? A: 参考にはなりますが結論ではありません。第三者再現を待つか、自社業務シナリオで A/B テストすることを推奨します。

まとめ: Qwen3.8-Max GA は国産 LLM「3T クラブ」競争の新たな節目です。Arena テキスト第 5 位、低 API 価格、Agent エコシステム統合は魅力的ですが、ウェイト未公開と「オープンソース」表記の先行が最大の争点です。本番移行前は独立ベンチ再現と自社 A/B テストを優先してください。

Agent ワークフローをクラウド API 呼び出しのみに依存すると、ネットワーク遅延、Token 請求の予測困難、モデルルート変更時の移行コストがボトルネックになります。純ローカル Ollama デプロイはユニファイドメモリ上限、7×24 安定性、マルチリージョン拡張に制約があります。Claude Code、Qoder CLI、OpenClaw、Xcode CI/CD をフル macOS 環境で動かし、Agent ノードを 7×24 常時稼働させたいチームには、CALMVPS ベアメタル Mac Mini M4 レンタルが通常より適しています。Apple Silicon 専有、Metal ネイティブ加速、六地域ノードの柔軟切替、約 120 秒デプロイで重 Agent ループをクラウドにオフロードできます。詳細は料金ページをご確認ください。

本番移行前に Qwen3.8-Max の最新料金、オープンウェイト公開状況、ベンチマーク数値を公式ソースで再確認してください。本稿情報は 2026 年 8 月初旬の公開資料に基づきます。