2026 年 8 月 3 日,阿里巴巴正式發布新一代旗艦大模型千問 Qwen3.8-Max並同步上線 Agent 產品「千問辦公」——總參數 2.4 兆、激活 950 億、100 萬 token 上下文,Arena 文本競技場排名第 5,是前 8 名中唯一的非 Anthropic 模型。
本文面向評估 API 選型、關注開源權重與 Agent 工具鏈遷移的開發者與技術決策者:梳理7 月 16 日至 8 月 3 日完整時間線、核心參數與跑分表、MoE 架構設計邏輯、與 Kimi K3 / DeepSeek V4 / Claude 的橫向對比、「開源」標籤爭議,並給出六步落地清單與 FAQ。讀完應能回答:現在能不能用、開源了沒有、和 Kimi K3 誰更強。
01 兩週時間線:Kimi K3 開源、Qwen 預覽、DeepSeek 反超、阿里 GA
2026 年 7 月中下旬,國產大模型進入密集發布窗口,節奏極快:
- 7 月 16 日:月之暗面發布 Kimi K3,2.8 兆參數(896 個專家中激活 16 個),主打獨立評測與透明技術報告路線。
- 7 月 19 日:Qwen3.8-Max 以預覽版先行開放,接入 Token Plan / Qoder / QoderWork,價格為預計正式價的 10%,但未公布激活參數量、未提供跑分表,服務條款還明確禁止自動化生產環境呼叫。
- 7 月 27 日:Kimi K3 按承諾時間開源權重,上線 Hugging Face,並同步開源部分底層基礎設施(注意力核心、MoE 通訊庫等)。
- 7 月 31 日:DeepSeek 發布 V4-Flash 正式版,在參數規模不變的前提下,靠架構與訓練優化讓智慧體、程式碼類基準大幅超過自家上一代 V4-Pro 預覽版。
- 8 月 3 日:Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」Agent 產品同步上線,對標騰訊 WorkBuddy、Moonshot Kimi Work。當天阿里巴巴港股上漲約 7%,美股上漲約 4.5%。
- 預計 8 月 10 日前後:Qwen3.8-Max 及其精簡版 Qwen3.8-27B 的權重計劃登陸 Hugging Face 與 ModelScope,但截至發稿,具體日期與開源協議條款均未公布。
參數競賽的敘事正在被「架構效率競賽」取代——DeepSeek V4-Flash 在不增參數的情況下反超自家更大模型,Qwen3.8-Max 的「大容量、低激活」設計正是同一條路線的延續。
02 Qwen3.8-Max 核心數據與跑分一覽(2026 年 8 月)
以下數據來自阿里官方發布材料(標註「阿里自測」的條目尚無第三方獨立複現),發布前請以官方最新公告為準。
| 項目 | 數值 |
|---|---|
| 發布日期 | 2026 年 8 月 3 日(GA) |
| 總參數 / 激活參數 | 2.4 兆 / 950 億 |
| 架構 | 基於 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文視窗 | 100 萬 token(思考模式約 98.3 萬,輸出上限 13.1 萬) |
| 輸入模態 | 文本 / 圖像 / 影片 |
| API 定價(國際) | 輸入 $2/百萬 token,輸出 $6/百萬 token |
| API 定價(國內) | 輸入 12 元/百萬 token,輸出 36 元/百萬 token |
| Arena 文本競技場(8 月 1 日快照) | 第 5 名,1496 分(Preliminary),前 8 名中唯一非 Anthropic 模型 |
| Arena 視覺競技場 | 第 2 名,僅次於 Claude Fable 5 |
| PaperBench(阿里自測) | 93.0(較上代提升 28.2 分) |
| SWE-bench Pro(阿里自測) | 67.7(落後 Fable 5 的 80.0) |
| 權重開源狀態 | 承諾「下週」,截至發稿未上線 |
03 2.4 兆參數背後:架構邏輯與四大爭議點
為什麼是 MoE + 混合注意力,而不是單純堆參數? Qwen3.8-Max 透過稀疏 MoE 把總參數做到 2.4 兆的同時,實際激活量控制在 950 億——推理成本更接近千億級模型,而非真正呼叫 2.4 兆參數。這也是 API 定價能壓到每百萬 token 輸入 $2、輸出 $6(明顯低於 Claude Opus 5 的 $5/$25 和 Fable 5 的 $10/$50)的根本原因。
reasoning_effort 三檔設計解決成本可控問題:模型提供 low / medium / xhigh 三檔推理強度(預設 xhigh),開發者可按任務複雜度調節速度與深度,支援透過 enable_thinking 參數或 Anthropic 相容介面的 reasoning.effort 欄位呼叫。
長程自主任務是核心賣點,但驗證方式值得關注。 阿里案例包括 16 天無人工介入的自主編碼專案、超過 500 步的晶片設計優化任務,以及自建 RecreationBench(黑盒環境下僅憑互動和視覺回饋還原真實應用)。這些評測均為阿里自建基準,公開程度有限。
生態卡位: Qwen3.8-Max 同步接入「千問辦公」Agent 平台,API 相容 OpenAI 與 Anthropic 兩種協議,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具鏈。
四大爭議與透明度痛點:
- 「Open-Source」標籤先於權重: 官網 GA 當天已標註開源,但 Hugging Face 和 ModelScope 上尚無對應倉庫、許可證或確切上線時間。
- 跑分均來自阿里自建框架: PaperBench、QwenSWEBench、RecreationBench 等均為內部基準,Artificial Analysis、Arena.ai 等中立平台截至發稿尚未對正式版給出獨立複現。
- 預覽版透明度不足: 7 月 19 日預覽版未公開激活參數、模型卡與安全評估,多家獨立評測機構當時建議勿遷移生產系統。
- 激活參數披露滯後: Kimi K3 公開約 500 億激活參數,DeepSeek 公開 490 億,阿里直到 GA 階段才補充披露「950 億」,預覽階段完全未說明。
在唯一一次可比的獨立盲測中(269 個檔案的真實專案架構設計任務),Kimi K3 得 83 分、Qwen3.8-Max 預覽版得 80 分——差距很小,屬於「互有勝負」而非「全面碾壓」。
04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude
| 模型 | 總參數/激活 | 定價(輸入/輸出,每百萬 token) | 權重開源 | 獨立第三方評測 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950 億 | $2 / $6 | 未開源(承諾中) | 暫無 |
| Kimi K3 | 2.8T / 約 500 億 | $3 / $15 | 已開源(7 月 27 日) | AA Intelligence Index ≈ 57.11 |
| DeepSeek V4-Flash | 同 V4-Pro | 未公開完整表 | 已開源 | 9 項智慧體/程式碼基準超 V4-Pro |
| Claude Opus 5 | 未公開 | $5 / $25 | 閉源 | Arena 前列 |
| Claude Fable 5 | 未公開 | $10 / $50 | 閉源 | Arena 文本競技場第 1 |
六步落地指南(評估 Qwen3.8-Max 是否適合你的場景):
- 明確呼叫方式: 若走 API,透過 QwenCloud 呼叫,相容 OpenAI 與 Anthropic 兩種介面協議;若需本地私有化部署,等待 Qwen3.8-27B 精簡版開源或評估 Kimi K3 已開源權重。
- 核對開源狀態: 截至 8 月 4 日權重尚未發布,勿將官網「Open-Source」標籤等同於可下載權重;關注 Hugging Face / ModelScope 官方倉庫上線公告。
- 配置 reasoning_effort: 按任務複雜度選擇 low / medium / xhigh 檔位,簡單任務用 low 控制成本,複雜 Agent 任務用 xhigh 獲取更深推理。
- 接入 Agent 工具鏈: 在 Claude Code、Qoder CLI、OpenClaw 等工具中替換 base URL 與 API Key,利用 Anthropic 相容介面降低遷移成本。
- 業務場景 A/B 測試: 勿僅憑阿里自測跑分做遷移決策,在自己的真實程式碼庫與 Agent 工作流中對比 Qwen3.8-Max 與 Kimi K3 / DeepSeek V4 的實際表現。
- 關注獨立評測複現: 等待 Artificial Analysis、Arena.ai 等平台對 GA 版本的正式複測結果,再決定是否將 Qwen3.8-Max 納入生產預設路由。
05 可引用技術數據、FAQ 與 Agent 基礎設施選型
- 總參數 vs 激活參數: Qwen3.8-Max 總參數 2.4 兆,實際每 token 激活 950 億,推理成本接近千億級密集模型而非 2.4T 全量呼叫。
- API 價格競爭力: 輸入 $2/百萬 token、輸出 $6/百萬 token,低於 Claude Opus 5($5/$25)和 Fable 5($10/$50),隱式快取命中低至 $0.25/百萬 token。
- 消費端落地案例: 蘋果在中國市場推出的 Apple Intelligence 功能,其生成式 AI 能力基於 Qwen 模型(經壓縮後本地運行於 iPhone 15 及以上機型),千問系列已延伸為數億部 iPhone 的系統級 AI 引擎。
FAQ 速答
- Qwen3.8-Max 現在能直接用嗎?開源了沒有? API 已可透過 QwenCloud 呼叫;權重尚未開源,預計 8 月 10 日前後公布,具體以官方公告為準。
- 和 Kimi K3 誰更強? 目前沒有權威統一評測。唯一獨立盲測顯示兩者打分接近(Kimi K3 83 分 vs Qwen 預覽版 80 分),Kimi K3 優勢是已開源且有第三方評測,Qwen3.8-Max 優勢是 API 價格更低、多模態更全面。
- 2.4 兆參數普通開發者用不起? 透過 API 呼叫成本接近千億級模型;本地部署完整版需多節點資料中心,更現實的選擇是等待 Qwen3.8-27B 精簡版開源。
- 阿里公布的跑分能信嗎? 可作參考但非定論,建議關注後續獨立評測複現,或在自己的業務場景做 A/B 測試。
若把 Agent 工作流完全押在雲端 API 呼叫上,短板是網路延遲、Token 帳單不可控、以及模型路由變更時的遷移成本;純本地 Ollama 部署則受限於統一記憶體上限、7×24 穩定性與多節點擴展。對需要完整 macOS 環境跑 Claude Code、Qoder CLI、OpenClaw 與 Xcode CI/CD、且希望 Agent 節點 7×24 線上的團隊,CALMVPS 裸金屬 Mac Mini M4 租賃通常是更優解:獨占 Apple Silicon、六地節點彈性切換、120 秒交付。機型與即時價格見 CALMVPS 定價頁。
發布前請核實 Qwen3.8-Max 最新定價、開源時間與跑分數據,本文資訊以 2026 年 8 月初公開資料為準。