Alibaba Qwen3.8-Max GA:
2,4T параметров, Arena #5 — веса пока не открыты

3 августа 2026 Alibaba выпустила флагман Qwen3.8-Max в GA и запустила agent-продукт «Qwen Office» — 2,4 трлн total parameters, 95 млрд active на token, контекст 1M tokens, #5 на Arena Text Arena, единственная non-Anthropic модель в top 8.

Статья для разработчиков и tech leads, оценивающих API routing, open-weight timeline и миграцию agent toolchain. Внутри: таймлайн 16 июля–3 августа, таблица specs и benchmarks, логика MoE, сравнение с Kimi K3 / DeepSeek V4 / Claude, спор вокруг open-source label, а также шесть шагов rollout и FAQ. После прочтения вы поймёте: можно ли использовать сейчас, открыты ли веса, как модель стоит против Kimi K3.

01 Двухнедельный таймлайн: Kimi K3, preview Qwen, DeepSeek Flash, GA Alibaba

В конце июля 2026 китайские frontier labs выпускали модели в высоком темпе:

  • 16 июля: Moonshot AI релизит Kimi K3 (MoE 2,8T, 896 experts / 16 active) — фокус на независимых benchmarks и technical report.
  • 19 июля: preview Qwen3.8-Max через Token Plan, Qoder, QoderWork по 10 % будущей стандартной цены — без active parameters, без benchmark table, ToS запрещает automated production use.
  • 27 июля: Kimi K3 публикует open weights на Hugging Face по графику, вместе с частью serving infrastructure.
  • 31 июля: DeepSeek V4-Flash обходит собственную preview V4-Pro на девяти agent/coding benchmarks без роста параметров.
  • 3 августа: Qwen3.8-Max GA с полной benchmark table и «Qwen Office». Акции Alibaba HK +7 %, US listing +4,5 %.
  • «На следующей неделе» (ожидание ~10 августа): open weights для Qwen3.8-Max и Qwen3.8-27B обещаны на Hugging Face и ModelScope — на момент публикации нет репозитория, лицензии и firm date.

Нарратив «scale everything» уступает гонке архитектурной эффективности — DeepSeek V4-Flash улучшился без прироста параметров; Qwen3.8-Max ставит на «большой total, малый active».

02 Спецификации и benchmarks Qwen3.8-Max (август 2026)

Данные из launch materials Alibaba. Строки «vendor-run» на момент публикации не воспроизведены независимо. Перед production migration сверяйтесь с официальными источниками.

Ключевые specs Qwen3.8-Max (GA, 3 августа 2026)
Параметр Значение
Дата GA3 августа 2026
Total / active parameters2,4T / 95B
АрхитектураSparse MoE + hybrid attention на базе Qwen3.5
Context window1M tokens (≈983K с thinking; max output 131K)
Input modalitiesText, image, video
API pricing (international)$2 / $6 за 1M input/output tokens
Arena Text Arena (snapshot 1 авг.)#5, 1496 points (Preliminary) — единственный non-Anthropic в top 8
Arena Vision Arena#2, после Claude Fable 5
PaperBench (vendor-run)93,0 (+28,2 vs prior generation)
SWE-bench Pro (vendor-run)67,7 — ниже Fable 5 (80,0)
Open weightsОбещаны «на следующей неделе»; на момент публикации не опубликованы

03 Архитектурная логика и четыре риска прозрачности

Почему sparse MoE, а не dense scaling? Qwen3.8-Max доводит total parameters до 2,4T при активации лишь 95B на token. Стоимость inference следует active count, а не total — отсюда API $2/$6 за 1M tokens, заметно ниже Claude Opus 5 ($5/$25) и Fable 5 ($10/$50).

reasoning_effort как cost control: три уровня — low, medium, xhigh (default) — балансируют latency и depth. Native API через enable_thinking, Anthropic-compatible interface через reasoning.effort.

Long-horizon autonomy — ключевой pitch: showcase cases включают 16-дневный coding project без human intervention, chip-design optimization на 500+ steps, RecreationBench (восстановление приложения только из black-box interaction). Benchmarks — internal Alibaba suite; partial trace на GitHub (qwen-code-dev-bot/oh-my-cli), но без independent audit.

Distribution: Qwen3.8-Max интегрирован в «Qwen Office», API совместим с OpenAI и Anthropic protocols — Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw через смену base URL.

Четыре риска прозрачности:

  • Label «Open-Source» до weights: qwen.ai пометил модель open-source в день GA — ни одного репозитория на Hugging Face или ModelScope, лицензии или ship date.
  • Benchmarks только vendor-run: PaperBench, QwenSWEBench, RecreationBench — neutral platforms не воспроизвели GA numbers.
  • Preview transparency gaps: preview 19 июля без active parameters, model card и safety eval — independent evaluators советовали не мигрировать production.
  • Delayed active-parameter disclosure: Kimi K3 ~50B, DeepSeek V4-Pro 49B — Alibaba раскрыл «95B» только на GA, в preview — ничего.

В единственном сопоставимом independent test (blind software architecture, 269 files) Kimi K3 набрал 83/100, Qwen3.8-Max — 80/100: parity, а не clear dominance.

04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

Сравнение frontier models (август 2026)
Модель Total / active Цена (in/out за 1M tokens) Open weights? Independent benchmark
Qwen3.8-Max2,4T / 95B$2 / $6Обещаны, не опубликованыПока нет
Kimi K32,8T / ~50B$3 / $15Опубликованы 27 июляAA Intelligence Index ≈ 57,11
DeepSeek V4-FlashКак V4-ProНе полностью опубликованаОпубликованы9 agent/coding benchmarks > V4-Pro
Claude Opus 5Не раскрыто$5 / $25ClosedTop Arena ranking
Claude Fable 5Не раскрыто$10 / $50Closed#1 Arena Text Arena

Шесть шагов rollout (подходит ли Qwen3.8-Max вашему stack):

  1. Выбрать access path: QwenCloud API (OpenAI или Anthropic-compatible protocols) для hosted inference; для on-prem дождаться Qwen3.8-27B или оценить уже опубликованные weights Kimi K3.
  2. Проверить open-weight status: на 4 августа weights не опубликованы. Label «Open-Source» на qwen.ai ≠ downloadable artifact, пока нет репозитория.
  3. Настроить reasoning_effort: сопоставить low / medium / xhigh сложности задачи — low для простых calls, xhigh для deep agent workflows.
  4. Подключить agent toolchain: заменить base URL и API key в Claude Code, Qoder CLI или OpenClaw через Anthropic-compatible endpoint.
  5. Запустить workload A/B tests: не мигрировать только по vendor benchmarks. Сравнить Qwen3.8-Max с Kimi K3 и DeepSeek V4 на реальных codebases и agent flows.
  6. Дождаться independent reproduction: следить за Artificial Analysis и Arena.ai для third-party GA scores перед тем, как сделать Qwen3.8-Max default production route.

05 Цитируемые данные, FAQ и выбор agent infrastructure

  • Total vs active: 2,4T total, 95B activated per token — inference cost ближе к ~100B dense model, а не full 2,4T call.
  • API price competitiveness: $2/$6 за 1M tokens ниже Claude Opus 5 ($5/$25) и Fable 5 ($10/$50); implicit cache hits от $0,25 за 1M tokens.
  • Consumer reach: Apple Intelligence в Китае работает на Qwen — compressed ~27B checkpoint под 4 GB on-device на iPhone 15+, расширяя reach Qwen за пределы API benchmarks.

FAQ

  • Qwen3.8-Max open source прямо сейчас? Нет. API live через Alibaba Cloud Model Studio; weights не опубликованы. «Open-Source» на qwen.ai описывает intent, а не shipped artifact.
  • Сравнение с Kimi K3? Нет единого authoritative head-to-head. Единственный independent comparison: Kimi K3 83/100 vs Qwen 80/100. Плюс K3 — public weights и AA score; плюс Qwen — ниже API pricing и шире native multimodal.
  • 2,4T означает datacenter? Для full checkpoint — да. API это обходит. On-prem — target Qwen3.8-27B после публикации weights.
  • Можно ли доверять benchmarks Alibaba? Treat as vendor claims. Ждите third-party reproduction или тестируйте на своих workloads.

Полная зависимость от cloud API calls для agent workflows означает latency, unpredictable token bills и migration cost при смене routing. Pure local Ollama упирается в unified memory ceilings, 24/7 stability limits и multi-region scaling friction. Для команд, которым нужен full macOS stack (Claude Code, Qoder CLI, OpenClaw, Xcode CI/CD) с always-on agent nodes, аренда bare-metal Mac Mini M4 CALMVPS обычно лучший fit: dedicated Apple Silicon, шесть регионов, provisioning ~120 s. Актуальные цены на странице тарифов CALMVPS.

Перед migration сверьте текущие цены Qwen3.8-Max, статус open weights и benchmark figures с официальными источниками. Данные на начало августа 2026.