阿里 Qwen3.8-Max 发布:
2.4 万亿参数冲进 Arena 全球前五,下周开源

2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰大模型千问 Qwen3.8-Max并同步上线 Agent 产品「千问办公」——总参数 2.4 万亿、激活 950 亿100 万 token 上下文,Arena 文本竞技场排名第 5,是前 8 名中唯一的非 Anthropic 模型。

本文面向评估 API 选型、关注开源权重与 Agent 工具链迁移的开发者与技术决策者:梳理7 月 16 日至 8 月 3 日完整时间线、核心参数与跑分表、MoE 架构设计逻辑、与 Kimi K3 / DeepSeek V4 / Claude 的横向对比、「开源」标签争议,并给出六步落地清单与 FAQ。读完应能回答:现在能不能用、开源了没有、和 Kimi K3 谁更强。

01 两周时间线:Kimi K3 开源、Qwen 预览、DeepSeek 反超、阿里 GA

2026 年 7 月中下旬,国产大模型进入密集发布窗口,节奏极快:

  • 7 月 16 日:月之暗面发布 Kimi K3,2.8 万亿参数(896 个专家中激活 16 个),主打独立评测与透明技术报告路线。
  • 7 月 19 日:Qwen3.8-Max 以预览版先行开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,但未公布激活参数量、未提供跑分表,服务条款还明确禁止自动化生产环境调用。
  • 7 月 27 日:Kimi K3 按承诺时间开源权重,上线 Hugging Face,并同步开源部分底层基础设施(注意力内核、MoE 通信库等)。
  • 7 月 31 日:DeepSeek 发布 V4-Flash 正式版,在参数规模不变的前提下,靠架构与训练优化让智能体、代码类基准大幅超过自家上一代 V4-Pro 预览版。
  • 8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」Agent 产品同步上线,对标腾讯 WorkBuddy、Moonshot Kimi Work。当天阿里巴巴港股上涨约 7%,美股上涨约 4.5%。
  • 预计 8 月 10 日前后:Qwen3.8-Max 及其精简版 Qwen3.8-27B 的权重计划登陆 Hugging Face 与 ModelScope,但截至发稿,具体日期与开源协议条款均未公布。

参数竞赛的叙事正在被「架构效率竞赛」取代——DeepSeek V4-Flash 在不增参数的情况下反超自家更大模型,Qwen3.8-Max 的「大容量、低激活」设计正是同一路线的延续。

02 Qwen3.8-Max 核心数据与跑分一览(2026 年 8 月)

以下数据来自阿里官方发布材料(标注「阿里自测」的条目尚无第三方独立复现),发布前请以官方最新公告为准。

Qwen3.8-Max 核心规格与基准(2026 年 8 月 3 日 GA)
项目 数值
发布日期2026 年 8 月 3 日(GA)
总参数 / 激活参数2.4 万亿 / 950 亿
架构基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口100 万 token(思考模式约 98.3 万,输出上限 13.1 万)
输入模态文本 / 图像 / 视频
API 定价(国际)输入 $2/百万 token,输出 $6/百万 token
API 定价(国内)输入 12 元/百万 token,输出 36 元/百万 token
Arena 文本竞技场(8 月 1 日快照)第 5 名,1496 分(Preliminary),前 8 名中唯一非 Anthropic 模型
Arena 视觉竞技场第 2 名,仅次于 Claude Fable 5
PaperBench(阿里自测)93.0(较上代提升 28.2 分)
SWE-bench Pro(阿里自测)67.7(落后 Fable 5 的 80.0)
权重开源状态承诺「下周」,截至发稿未上线

03 2.4 万亿参数背后:架构逻辑与四大争议点

为什么是 MoE + 混合注意力,而不是单纯堆参数? Qwen3.8-Max 通过稀疏 MoE 把总参数做到 2.4 万亿的同时,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4 万亿参数。这也是 API 定价能压到每百万 token 输入 $2、输出 $6(明显低于 Claude Opus 5 的 $5/$25 和 Fable 5 的 $10/$50)的根本原因。

reasoning_effort 三档设计解决成本可控问题:模型提供 low / medium / xhigh 三档推理强度(默认 xhigh),开发者可按任务复杂度调节速度与深度,支持通过 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段调用。

长程自主任务是核心卖点,但验证方式值得关注。 阿里案例包括 16 天无人工介入的自主编码项目、超过 500 步的芯片设计优化任务,以及自建 RecreationBench(黑盒环境下仅凭交互和视觉反馈还原真实应用)。这些评测均为阿里自建基准,公开程度有限。

生态卡位: Qwen3.8-Max 同步接入「千问办公」Agent 平台,API 兼容 OpenAI 与 Anthropic 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。

四大争议与透明度痛点:

  • 「Open-Source」标签先于权重: 官网 GA 当天已标注开源,但 Hugging Face 和 ModelScope 上尚无对应仓库、许可证或确切上线时间。
  • 跑分均来自阿里自建框架: PaperBench、QwenSWEBench、RecreationBench 等均为内部基准,Artificial Analysis、Arena.ai 等中立平台截至发稿尚未对正式版给出独立复现。
  • 预览版透明度不足: 7 月 19 日预览版未公开激活参数、模型卡与安全评估,多家独立评测机构当时建议勿迁移生产系统。
  • 激活参数披露滞后: Kimi K3 公开约 500 亿激活参数,DeepSeek 公开 490 亿,阿里直到 GA 阶段才补充披露「950 亿」,预览阶段完全未说明。

在唯一一次可比的独立盲测中(269 个文件的真实项目架构设计任务),Kimi K3 得 83 分、Qwen3.8-Max 预览版得 80 分——差距很小,属于「互有胜负」而非「全面碾压」。

04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

2026 年 8 月前沿模型横向对比
模型 总参数/激活 定价(输入/输出,每百万 token) 权重开源 独立第三方评测
Qwen3.8-Max2.4T / 950 亿$2 / $6未开源(承诺中)暂无
Kimi K32.8T / 约 500 亿$3 / $15已开源(7 月 27 日)AA Intelligence Index ≈ 57.11
DeepSeek V4-Flash同 V4-Pro未公开完整表已开源9 项智能体/代码基准超 V4-Pro
Claude Opus 5未公开$5 / $25闭源Arena 前列
Claude Fable 5未公开$10 / $50闭源Arena 文本竞技场第 1

六步落地指南(评估 Qwen3.8-Max 是否适合你的场景):

  1. 明确调用方式: 若走 API,通过 QwenCloud 调用,兼容 OpenAI 与 Anthropic 两种接口协议;若需本地私有化部署,等待 Qwen3.8-27B 精简版开源或评估 Kimi K3 已开源权重。
  2. 核对开源状态: 截至 8 月 4 日权重尚未发布,勿将官网「Open-Source」标签等同于可下载权重;关注 Hugging Face / ModelScope 官方仓库上线公告。
  3. 配置 reasoning_effort: 按任务复杂度选择 low / medium / xhigh 档位,简单任务用 low 控制成本,复杂 Agent 任务用 xhigh 获取更深推理。
  4. 接入 Agent 工具链: 在 Claude Code、Qoder CLI、OpenClaw 等工具中替换 base URL 与 API Key,利用 Anthropic 兼容接口降低迁移成本。
  5. 业务场景 A/B 测试: 勿仅凭阿里自测跑分做迁移决策,在自己的真实代码库与 Agent 工作流中对比 Qwen3.8-Max 与 Kimi K3 / DeepSeek V4 的实际表现。
  6. 关注独立评测复现: 等待 Artificial Analysis、Arena.ai 等平台对 GA 版本的正式复测结果,再决定是否将 Qwen3.8-Max 纳入生产默认路由。

05 可引用技术数据、FAQ 与 Agent 基础设施选型

  • 总参数 vs 激活参数: Qwen3.8-Max 总参数 2.4 万亿,实际每 token 激活 950 亿,推理成本接近千亿级密集模型而非 2.4T 全量调用。
  • API 价格竞争力: 输入 $2/百万 token、输出 $6/百万 token,低于 Claude Opus 5($5/$25)和 Fable 5($10/$50),隐式缓存命中低至 $0.25/百万 token。
  • 消费端落地案例: 苹果在中国市场推出的 Apple Intelligence 功能,其生成式 AI 能力基于 Qwen 模型(经压缩后本地运行于 iPhone 15 及以上机型),千问系列已延伸为数亿部 iPhone 的系统级 AI 引擎。

FAQ 速答

  • Qwen3.8-Max 现在能直接用吗?开源了没有? API 已可通过 QwenCloud 调用;权重尚未开源,预计 8 月 10 日前后公布,具体以官方公告为准。
  • 和 Kimi K3 谁更强? 目前没有权威统一评测。唯一独立盲测显示两者打分接近(Kimi K3 83 分 vs Qwen 预览版 80 分),Kimi K3 优势是已开源且有第三方评测,Qwen3.8-Max 优势是 API 价格更低、多模态更全面。
  • 2.4 万亿参数普通开发者用不起? 通过 API 调用成本接近千亿级模型;本地部署完整版需多节点数据中心,更现实的选择是等待 Qwen3.8-27B 精简版开源。
  • 阿里公布的跑分能信吗? 可作参考但非定论,建议关注后续独立评测复现,或在自己的业务场景做 A/B 测试。

若把 Agent 工作流完全押在云端 API 调用上,短板是网络延迟、Token 账单不可控、以及模型路由变更时的迁移成本;纯本地 Ollama 部署则受限于统一内存上限、7×24 稳定性与多节点扩展。对需要完整 macOS 环境跑 Claude Code、Qoder CLI、OpenClaw 与 Xcode CI/CD、且希望 Agent 节点 7×24 在线的团队,CALMVPS 裸金属 Mac Mini M4 租赁通常是更优解:独占 Apple Silicon、六地节点弹性切换、120 秒交付。机型与实时价格见 CALMVPS 定价页

发布前请核实 Qwen3.8-Max 最新定价、开源时间与跑分数据,本文信息以 2026 年 8 月初公开资料为准。