2026 年 8 月 3 日,阿里巴巴正式发布新一代旗舰大模型千问 Qwen3.8-Max并同步上线 Agent 产品「千问办公」——总参数 2.4 万亿、激活 950 亿、100 万 token 上下文,Arena 文本竞技场排名第 5,是前 8 名中唯一的非 Anthropic 模型。
本文面向评估 API 选型、关注开源权重与 Agent 工具链迁移的开发者与技术决策者:梳理7 月 16 日至 8 月 3 日完整时间线、核心参数与跑分表、MoE 架构设计逻辑、与 Kimi K3 / DeepSeek V4 / Claude 的横向对比、「开源」标签争议,并给出六步落地清单与 FAQ。读完应能回答:现在能不能用、开源了没有、和 Kimi K3 谁更强。
01 两周时间线:Kimi K3 开源、Qwen 预览、DeepSeek 反超、阿里 GA
2026 年 7 月中下旬,国产大模型进入密集发布窗口,节奏极快:
- 7 月 16 日:月之暗面发布 Kimi K3,2.8 万亿参数(896 个专家中激活 16 个),主打独立评测与透明技术报告路线。
- 7 月 19 日:Qwen3.8-Max 以预览版先行开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%,但未公布激活参数量、未提供跑分表,服务条款还明确禁止自动化生产环境调用。
- 7 月 27 日:Kimi K3 按承诺时间开源权重,上线 Hugging Face,并同步开源部分底层基础设施(注意力内核、MoE 通信库等)。
- 7 月 31 日:DeepSeek 发布 V4-Flash 正式版,在参数规模不变的前提下,靠架构与训练优化让智能体、代码类基准大幅超过自家上一代 V4-Pro 预览版。
- 8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」Agent 产品同步上线,对标腾讯 WorkBuddy、Moonshot Kimi Work。当天阿里巴巴港股上涨约 7%,美股上涨约 4.5%。
- 预计 8 月 10 日前后:Qwen3.8-Max 及其精简版 Qwen3.8-27B 的权重计划登陆 Hugging Face 与 ModelScope,但截至发稿,具体日期与开源协议条款均未公布。
参数竞赛的叙事正在被「架构效率竞赛」取代——DeepSeek V4-Flash 在不增参数的情况下反超自家更大模型,Qwen3.8-Max 的「大容量、低激活」设计正是同一路线的延续。
02 Qwen3.8-Max 核心数据与跑分一览(2026 年 8 月)
以下数据来自阿里官方发布材料(标注「阿里自测」的条目尚无第三方独立复现),发布前请以官方最新公告为准。
| 项目 | 数值 |
|---|---|
| 发布日期 | 2026 年 8 月 3 日(GA) |
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 |
| 架构 | 基于 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 token(思考模式约 98.3 万,输出上限 13.1 万) |
| 输入模态 | 文本 / 图像 / 视频 |
| API 定价(国际) | 输入 $2/百万 token,输出 $6/百万 token |
| API 定价(国内) | 输入 12 元/百万 token,输出 36 元/百万 token |
| Arena 文本竞技场(8 月 1 日快照) | 第 5 名,1496 分(Preliminary),前 8 名中唯一非 Anthropic 模型 |
| Arena 视觉竞技场 | 第 2 名,仅次于 Claude Fable 5 |
| PaperBench(阿里自测) | 93.0(较上代提升 28.2 分) |
| SWE-bench Pro(阿里自测) | 67.7(落后 Fable 5 的 80.0) |
| 权重开源状态 | 承诺「下周」,截至发稿未上线 |
03 2.4 万亿参数背后:架构逻辑与四大争议点
为什么是 MoE + 混合注意力,而不是单纯堆参数? Qwen3.8-Max 通过稀疏 MoE 把总参数做到 2.4 万亿的同时,实际激活量控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4 万亿参数。这也是 API 定价能压到每百万 token 输入 $2、输出 $6(明显低于 Claude Opus 5 的 $5/$25 和 Fable 5 的 $10/$50)的根本原因。
reasoning_effort 三档设计解决成本可控问题:模型提供 low / medium / xhigh 三档推理强度(默认 xhigh),开发者可按任务复杂度调节速度与深度,支持通过 enable_thinking 参数或 Anthropic 兼容接口的 reasoning.effort 字段调用。
长程自主任务是核心卖点,但验证方式值得关注。 阿里案例包括 16 天无人工介入的自主编码项目、超过 500 步的芯片设计优化任务,以及自建 RecreationBench(黑盒环境下仅凭交互和视觉反馈还原真实应用)。这些评测均为阿里自建基准,公开程度有限。
生态卡位: Qwen3.8-Max 同步接入「千问办公」Agent 平台,API 兼容 OpenAI 与 Anthropic 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等主流 Agent 工具链。
四大争议与透明度痛点:
- 「Open-Source」标签先于权重: 官网 GA 当天已标注开源,但 Hugging Face 和 ModelScope 上尚无对应仓库、许可证或确切上线时间。
- 跑分均来自阿里自建框架: PaperBench、QwenSWEBench、RecreationBench 等均为内部基准,Artificial Analysis、Arena.ai 等中立平台截至发稿尚未对正式版给出独立复现。
- 预览版透明度不足: 7 月 19 日预览版未公开激活参数、模型卡与安全评估,多家独立评测机构当时建议勿迁移生产系统。
- 激活参数披露滞后: Kimi K3 公开约 500 亿激活参数,DeepSeek 公开 490 亿,阿里直到 GA 阶段才补充披露「950 亿」,预览阶段完全未说明。
在唯一一次可比的独立盲测中(269 个文件的真实项目架构设计任务),Kimi K3 得 83 分、Qwen3.8-Max 预览版得 80 分——差距很小,属于「互有胜负」而非「全面碾压」。
04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude
| 模型 | 总参数/激活 | 定价(输入/输出,每百万 token) | 权重开源 | 独立第三方评测 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950 亿 | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 2.8T / 约 500 亿 | $3 / $15 | 已开源(7 月 27 日) | AA Intelligence Index ≈ 57.11 |
| DeepSeek V4-Flash | 同 V4-Pro | 未公开完整表 | 已开源 | 9 项智能体/代码基准超 V4-Pro |
| Claude Opus 5 | 未公开 | $5 / $25 | 闭源 | Arena 前列 |
| Claude Fable 5 | 未公开 | $10 / $50 | 闭源 | Arena 文本竞技场第 1 |
六步落地指南(评估 Qwen3.8-Max 是否适合你的场景):
- 明确调用方式: 若走 API,通过 QwenCloud 调用,兼容 OpenAI 与 Anthropic 两种接口协议;若需本地私有化部署,等待 Qwen3.8-27B 精简版开源或评估 Kimi K3 已开源权重。
- 核对开源状态: 截至 8 月 4 日权重尚未发布,勿将官网「Open-Source」标签等同于可下载权重;关注 Hugging Face / ModelScope 官方仓库上线公告。
- 配置 reasoning_effort: 按任务复杂度选择 low / medium / xhigh 档位,简单任务用 low 控制成本,复杂 Agent 任务用 xhigh 获取更深推理。
- 接入 Agent 工具链: 在 Claude Code、Qoder CLI、OpenClaw 等工具中替换 base URL 与 API Key,利用 Anthropic 兼容接口降低迁移成本。
- 业务场景 A/B 测试: 勿仅凭阿里自测跑分做迁移决策,在自己的真实代码库与 Agent 工作流中对比 Qwen3.8-Max 与 Kimi K3 / DeepSeek V4 的实际表现。
- 关注独立评测复现: 等待 Artificial Analysis、Arena.ai 等平台对 GA 版本的正式复测结果,再决定是否将 Qwen3.8-Max 纳入生产默认路由。
05 可引用技术数据、FAQ 与 Agent 基础设施选型
- 总参数 vs 激活参数: Qwen3.8-Max 总参数 2.4 万亿,实际每 token 激活 950 亿,推理成本接近千亿级密集模型而非 2.4T 全量调用。
- API 价格竞争力: 输入 $2/百万 token、输出 $6/百万 token,低于 Claude Opus 5($5/$25)和 Fable 5($10/$50),隐式缓存命中低至 $0.25/百万 token。
- 消费端落地案例: 苹果在中国市场推出的 Apple Intelligence 功能,其生成式 AI 能力基于 Qwen 模型(经压缩后本地运行于 iPhone 15 及以上机型),千问系列已延伸为数亿部 iPhone 的系统级 AI 引擎。
FAQ 速答
- Qwen3.8-Max 现在能直接用吗?开源了没有? API 已可通过 QwenCloud 调用;权重尚未开源,预计 8 月 10 日前后公布,具体以官方公告为准。
- 和 Kimi K3 谁更强? 目前没有权威统一评测。唯一独立盲测显示两者打分接近(Kimi K3 83 分 vs Qwen 预览版 80 分),Kimi K3 优势是已开源且有第三方评测,Qwen3.8-Max 优势是 API 价格更低、多模态更全面。
- 2.4 万亿参数普通开发者用不起? 通过 API 调用成本接近千亿级模型;本地部署完整版需多节点数据中心,更现实的选择是等待 Qwen3.8-27B 精简版开源。
- 阿里公布的跑分能信吗? 可作参考但非定论,建议关注后续独立评测复现,或在自己的业务场景做 A/B 测试。
若把 Agent 工作流完全押在云端 API 调用上,短板是网络延迟、Token 账单不可控、以及模型路由变更时的迁移成本;纯本地 Ollama 部署则受限于统一内存上限、7×24 稳定性与多节点扩展。对需要完整 macOS 环境跑 Claude Code、Qoder CLI、OpenClaw 与 Xcode CI/CD、且希望 Agent 节点 7×24 在线的团队,CALMVPS 裸金属 Mac Mini M4 租赁通常是更优解:独占 Apple Silicon、六地节点弹性切换、120 秒交付。机型与实时价格见 CALMVPS 定价页。
发布前请核实 Qwen3.8-Max 最新定价、开源时间与跑分数据,本文信息以 2026 年 8 月初公开资料为准。