2026 年 8 月 3 日、阿里巴巴は次世代フラッグシップ大規模言語モデル千問 Qwen3.8-Maxを正式 GA 公開し、Agent 製品「千問办公(Qwen Office)」を同時にローンチしました。総パラメータ2.4 兆(2.4T)、token あたり活性950 億(95B)、100 万 tokenコンテキスト、Arena テキスト竞技场で第 5 位——上位 8 名中唯一の非 Anthropic モデルです。
本稿はAPI 選定、オープンウェイト公開時期、Agent ツールチェーン移行を検討する開発者と技術意思決定者向けです。7 月 16 日から 8 月 3 日までのタイムライン、コア仕様とベンチマーク表、MoE アーキテクチャの設計思想、Kimi K3 / DeepSeek V4 / Claude との横断比較、「オープンソース」ラベル争点を整理し、六段階導入チェックリストと FAQを提供します。読了後、「今すぐ使えるか」「ウェイトは公開されたか」「Kimi K3 とどちらが強いか」を判断できる状態を目指します。
01 二週間のタイムライン:Kimi K3 公開、Qwen プレビュー、DeepSeek 逆転、阿里 GA
GA 前に押さえるべき選定リスク:
- 「Open-Source」表示と実体の乖離:qwen.ai は GA 当日からオープンソース表記を掲げましたが、Hugging Face と ModelScope にはリポジトリもライセンスもありません。法務・コンプライアンス判断を誤るリスクがあります。
- ベンチマークがベンダー自社実行:PaperBench、QwenSWEBench、RecreationBench 等は阿里内部ベンチです。Artificial Analysis や Arena.ai による GA 版の独立再現は、執筆時点では未公開です。
- プレビュー期の情報不足:7 月 19 日プレビューは活性パラメータ未公開、モデルカードなし、安全評価なし、利用規約で自動化生産環境呼び出しを禁止していました。複数の独立評価機関が本番移行を非推奨としていました。
- 活性パラメータ開示の遅れ:Kimi K3 は約 500 億、DeepSeek V4-Pro は 490 億を早期開示しましたが、阿里はプレビュー期に一切示さず、GA で初めて 950 億を公表しました。
2026 年 7 月中下旬、国産 LLM は密集リリース期に入り、ペースは極めて速くなりました。
- 7 月 16 日:月之暗面が Kimi K3 を公開。2.8T パラメータ(896 エキスパート中 16 活性化)。独立ベンチマークと技術レポートの透明性路線を打ち出しました。
- 7 月 19 日:Qwen3.8-Max プレビューが Token Plan / Qoder / QoderWork 経由で先行開放。正式価格の 10% ですが、活性パラメータ未公開、ベンチ表なし、自動化生産利用禁止条項あり。
- 7 月 27 日:Kimi K3 が約束どおり完全ウェイトを Hugging Face で公開。Attention カーネル、MoE 通信ライブラリ等の一部 Infra も同時 OSS 化しました。
- 7 月 31 日:DeepSeek が V4-Flash 正式版を公開。パラメータ規模を増やさず、アーキテクチャと学習最適化で Agent・コード系ベンチが自社 V4-Pro プレビューを大幅に上回りました。
- 8 月 3 日:Qwen3.8-Max が GA。完全ベンチ表と「千問办公」Agent 製品が同時ローンチ。腾讯 WorkBuddy、Moonshot Kimi Work と競合します。当日、阿里巴巴香港株は約 7%、米国株は約 4.5% 上昇しました。
- 8 月 10 日前後(予定):Qwen3.8-Max と小型版 Qwen3.8-27B のウェイトが Hugging Face と ModelScope に公開される予定ですが、執筆時点では具体日とライセンス条項は未公表です。
「パラメータ競争」の物語は「アーキテクチャ効率競争」へ移行しています。DeepSeek V4-Flash はパラメータを増やさず自社のより大きいモデルを上回り、Qwen3.8-Max の「大容量・低活性」設計も同じ賭けです。
02 Qwen3.8-Max コア仕様とベンチマーク一覧(2026 年 8 月)
以下は阿里公式公開資料に基づきます。「阿里自測」と明記した項目は、執筆時点で第三者独立再現はありません。本番移行前は公式最新公告で再確認してください。
| 項目 | 値 |
|---|---|
| GA 日 | 2026 年 8 月 3 日 |
| 総パラメータ / 活性パラメータ | 2.4 兆 / 950 億 |
| アーキテクチャ | Qwen3.5 ベースのスパース MoE + ハイブリッド Attention |
| コンテキストウィンドウ | 100 万 token(思考モード約 98.3 万、最大出力 13.1 万) |
| 入力モダリティ | テキスト / 画像 / 動画 |
| API 料金(国際) | 入力 $2/百万 token、出力 $6/百万 token |
| API 料金(国内) | 入力 12 元/百万 token、出力 36 元/百万 token |
| Arena テキスト竞技场(8 月 1 日スナップショット) | 第 5 位、1496 点(Preliminary)。上位 8 名中唯一の非 Anthropic モデル |
| Arena ビジョン竞技场 | 第 2 位。Claude Fable 5 に次ぐ |
| PaperBench(阿里自測) | 93.0(前世代比 +28.2 点) |
| SWE-bench Pro(阿里自測) | 67.7(Fable 5 の 80.0 に劣る) |
| ウェイト公開状態 | 「来週公開」と約束。執筆時点では未公開 |
03 2.4 兆パラメータの裏側:アーキテクチャ論理と四つの透明度争点
なぜ Dense パラメータの単純積み上げではなく MoE + ハイブリッド Attention なのか? Qwen3.8-Max はスパース MoE で総パラメータを 2.4 兆にしつつ、実際の活性量を 950 億に抑えます。推論コストは 2.4T 全量呼び出しではなく、千亿級モデルに近い水準です。これが API 料金を入力 $2・出力 $6(Claude Opus 5 の $5/$25、Fable 5 の $10/$50 を大きく下回る)に抑えられる根本理由です。
reasoning_effort 三档設計はコスト制御のための機能です。low / medium / xhigh(デフォルト xhigh)の三档で推論強度を調整できます。ネイティブ API の enable_thinking パラメータ、または Anthropic 互換インターフェースの reasoning.effort フィールド経由で呼び出せます。
長期自律タスクがコア訴求ですが、検証方法には注意が必要です。 阿里の事例には、16 日間無人工介入の自律コーディングプロジェクト、500 ステップ超のチップ設計最適化、自社 RecreationBench(ブラックボックス環境で対話と視覚フィードバックのみから実アプリを再現)が含まれます。これらは阿里自社ベンチで、公開度は限定的です。GitHub の qwen-code-dev-bot/oh-my-cli に部分トレースがありますが、独立監査済み結果ではありません。
エコシステム配置: Qwen3.8-Max は「千問办公」Agent プラットフォームに同期接続され、OpenAI 互換と Anthropic 互換の両 API プロトコルに対応します。Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等の主流 Agent ツールチェーンに base URL 差し替えで接続できます。
四つの争点と透明度の痛点:
- 「Open-Source」ラベルがウェイトに先行: 公式サイトは GA 当日からオープンソース表記を掲げましたが、Hugging Face / ModelScope に対応リポジトリ、ライセンス、確定公開日はありません。
- ベンチマークがすべてベンダー自社フレームワーク: PaperBench、QwenSWEBench、RecreationBench 等は内部ベンチです。中立プラットフォームによる GA 版の独立再現は未公開です。
- プレビュー版の透明性不足: 7 月 19 日プレビューは活性パラメータ、モデルカード、安全評価を公開せず、複数の独立評価機関が本番移行を非推奨としました。
- 活性パラメータ開示の遅れ: Kimi K3 は約 500 億、DeepSeek は 490 億を早期開示。阿里はプレビュー期に一切示さず、GA で初めて 950 億を公表しました。
唯一の独立盲測(269 ファイルの実プロジェクトアーキテクチャ設計タスク)では、Kimi K3 が 83 点、Qwen3.8-Max プレビュー版が 80 点でした。差は小さく、「全面優位」ではなく「互角の勝負」です。
04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude
| モデル | 総パラメータ / 活性 | 料金(入力/出力、百万 token あたり) | ウェイト公開 | 独立第三者ベンチ |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950 億 | $2 / $6 | 未公開(約束中) | なし |
| Kimi K3 | 2.8T / 約 500 億 | $3 / $15 | 公開済み(7 月 27 日) | AA Intelligence Index ≈ 57.11 |
| DeepSeek V4-Flash | V4-Pro と同規模 | 完全表未公開 | 公開済み | 9 項目 Agent/コードベンチで V4-Pro 超 |
| Claude Opus 5 | 非公開 | $5 / $25 | クローズド | Arena 上位 |
| Claude Fable 5 | 非公開 | $10 / $50 | クローズド | Arena テキスト竞技场第 1 位 |
阿里は OpenAI 互換と Anthropic 互換の両 API を提供しています。既存プロジェクトは base URL と API キーの変更だけで接続できます。
from openai import OpenAI
client = OpenAI(
api_key="your_dashscope_api_key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "このコードベースを分析して..."}],
extra_body={"enable_thinking": True, "reasoning_effort": "xhigh"}
)
以下が主要な公式ソースです。リリースやページ更新後はリンクを再確認してください。
https://help.aliyun.com/zh/model-studio
六段階導入ガイド(Qwen3.8-Max が自社スタックに適合するか評価):
- 呼び出し経路の確定: API 利用なら QwenCloud(DashScope)経由で OpenAI / Anthropic 互換プロトコルを選択します。オンプレミスが必要なら Qwen3.8-27B 小型版のウェイト公開を待つか、Kimi K3 公開済みウェイトを評価します。
- オープンウェイト状態の確認: 8 月 4 日時点でウェイトは未公開です。公式「Open-Source」表記をダウンロード可能なウェイトと同一視しないでください。Hugging Face / ModelScope の公式リポジトリ公告を追跡します。
- reasoning_effort の設定: タスク複雑度に応じ low / medium / xhigh を選択します。単純タスクは low でコスト抑制、複雑 Agent タスクは xhigh で深い推論を取得します。
- Agent ツールチェーンへの接続: Claude Code、Qoder CLI、OpenClaw 等で base URL と API キーを差し替え、Anthropic 互換エンドポイントで移行コストを下げます。
- 業務シナリオ A/B テスト: 阿里自測ベンチだけで移行判断しないでください。自社の実コードベースと Agent ワークフローで Qwen3.8-Max と Kimi K3 / DeepSeek V4 を比較します。
- 独立ベンチ再現の待機: Artificial Analysis、Arena.ai 等の GA 版正式再測結果を待ち、本番デフォルトルートに組み込むか判断します。
05 引用可能データ、FAQ、まとめ
引用可能な主要データ(EEAT):
- 総パラメータ vs 活性パラメータ: Qwen3.8-Max は総 2.4 兆、token あたり活性 950 億。推論コストは 2.4T 全量呼び出しではなく千亿級 Dense モデルに近い(出典:阿里巴巴 GA 公開資料、2026-08-03)。
- API 価格競争力: 入力 $2/百万 token、出力 $6/百万 token。Claude Opus 5($5/$25)と Fable 5($10/$50)を下回り、暗黙キャッシュヒットは $0.25/百万 token まで低減(出典:阿里 Model Studio 料金表、2026-08)。
- 消費者向け展開: 中国市場の Apple Intelligence 生成 AI 能力は Qwen モデル(圧縮後ローカル実行)に基づき、iPhone 15 以降で端末内推論します。千問系列は数億台の iPhone のシステム級 AI エンジンに拡張されています(出典:Apple / 阿里公開情報、2026-07)。
よくある質問 FAQ:
- Q: Qwen3.8-Max は今すぐ使えますか?オープンソースですか? A: API は QwenCloud(DashScope)経由で利用可能です。ウェイトは未公開で、8 月 10 日前後の公開が予定されていますが、具体日は公式公告を確認してください。qwen.ai の「Open-Source」表記は現時点では意図を示すものであり、公開済みアーティファクトではありません。
- Q: Kimi K3 とどちらが強いですか? A: 権威ある統一ベンチはありません。唯一の独立盲測では Kimi K3 83 点 vs Qwen プレビュー 80 点で差は小さいです。Kimi K3 の強みは公開済みウェイトと第三者ベンチ、Qwen3.8-Max の強みは低い API 価格とより広いネイティブマルチモーダル対応です。
- Q: 2.4 兆パラメータは個人開発者には非現実的ですか? A: API 経由なら千亿級モデルに近いコストです。完全版のローカルデプロイには多ノードデータセンターが必要です。現実的な選択肢は Qwen3.8-27B 小型版のウェイト公開を待つことです。
- Q: 阿里公開のベンチマークは信頼できますか? A: 参考にはなりますが結論ではありません。第三者再現を待つか、自社業務シナリオで A/B テストすることを推奨します。
まとめ: Qwen3.8-Max GA は国産 LLM「3T クラブ」競争の新たな節目です。Arena テキスト第 5 位、低 API 価格、Agent エコシステム統合は魅力的ですが、ウェイト未公開と「オープンソース」表記の先行が最大の争点です。本番移行前は独立ベンチ再現と自社 A/B テストを優先してください。
Agent ワークフローをクラウド API 呼び出しのみに依存すると、ネットワーク遅延、Token 請求の予測困難、モデルルート変更時の移行コストがボトルネックになります。純ローカル Ollama デプロイはユニファイドメモリ上限、7×24 安定性、マルチリージョン拡張に制約があります。Claude Code、Qoder CLI、OpenClaw、Xcode CI/CD をフル macOS 環境で動かし、Agent ノードを 7×24 常時稼働させたいチームには、CALMVPS ベアメタル Mac Mini M4 レンタルが通常より適しています。Apple Silicon 専有、Metal ネイティブ加速、六地域ノードの柔軟切替、約 120 秒デプロイで重 Agent ループをクラウドにオフロードできます。詳細は料金ページをご確認ください。
本番移行前に Qwen3.8-Max の最新料金、オープンウェイト公開状況、ベンチマーク数値を公式ソースで再確認してください。本稿情報は 2026 年 8 月初旬の公開資料に基づきます。