Архитектура multi-agent 2026:
от паттернов к production

В 2024–2025 AI agents вышли из лаборатории в production — но многие команды быстро понимают: один LLM на все задачи ломается при масштабировании. Ответ — архитектура multi-agent collaboration (MAS). Внутренний Agent Bake-Off Google сократил время обработки с часа до десяти минут; AdaptOrch (2026) показывает, что топология оркестрации важнее базовой модели — прирост 12–23 %.

Гайд для AI-инженеров, backend-архитекторов и tech lead. Охватывает основы MAS, шесть паттернов оркестрации, LangGraph/CrewAI/AutoGen, MCP+A2A, production-практики, observability и типичные ловушки. После прочтения вы сможете спроектировать топологию, выбрать фреймворк и составить rollout в шесть шагов.

01 Почему одного agent недостаточно: боли и базовые концепции MAS

Боли: монолитный agent упирается в структурные потолки — не в слабость модели.

  • Потолок context window: промежуточные результаты заполняют контекст; качество рассуждений падает.
  • Размывание экспертизы: один agent на retrieval, код и review — всё посредственно.
  • Последовательное выполнение: subtasks по очереди; общее время = сумма шагов.
  • Single point of failure: ошибка одного agent останавливает всю цепочку.

Multi-agent system (MAS) — несколько независимых AI agents, работающих через явные протоколы и оркестрацию. Каждый agent должен быть ролевым, с доступом к tools, изолированным state и заменяемостью.

Три топологии управления
Топология Плюсы Минусы Типичные сценарии
Централизованная Аудируемость, контроль Узкое место orchestrator Compliance, финриски
Децентрализованная Высокая эластичность, низкая latency Сложный debug, non-determinism Debate code review
Иерархическая Баланс контроля и эластичности Средняя сложность design Enterprise support, Replit assistant

Вывод AdaptOrch: организация collaboration agents влияет на результат сильнее, чем выбор базовой модели.

02 Шесть паттернов оркестрации (покрывают ~95 % production)

Паттерн 1 — Sequential pipeline: выход A напрямую в B; строго линейно. Для жёстких зависимостей (контент, code review). LangGraph: StateGraph retriever → analyzer → writer; время = сумма шагов; предсказуемо и аудируемо.

pipeline.py
from langgraph.graph import StateGraph, START, END

builder = StateGraph(PipelineState)
builder.add_node("retriever", retrieval_agent)
builder.add_node("analyzer", analysis_agent)
builder.add_node("writer", writer_agent)
builder.add_edge(START, "retriever")
builder.add_edge("retriever", "analyzer")
builder.add_edge("analyzer", "writer")
builder.add_edge("writer", END)
pipeline = builder.compile()

Паттерн 2 — Parallel fan-out/fan-in: независимые subtasks параллельно; merge-узел объединяет. Время = max(T1, T2, …, Tn). LangGraph Send API возвращает списки Send; Annotated[list, operator.add] как reducer агрегирует без ручных lock.

Паттерн 3 — Hierarchical supervisor-worker: supervisor для intent, декомпозиции и routing; workers для domain-задач; synthesizer для сводки. Рекомендуется двухуровневый routing — keyword fast path (<1 ms, без LLM) + LLM routing для vague intent.

Паттерн 4 — Swarm/network: peer-to-peer без central coordinator; остановка по rounds, consensus или timeout. Для multi-round debate; в production осторожно — AutoGen GroupChat требует жёсткий max_round.

Паттерн 5 — Blackboard: общее structured workspace; agents читают/пишут при выполнении условий без явного scheduler. Для часовых/суточных async workflow и heterogeneous teams.

Паттерн 6 — Hybrid: комбинация паттернов — типично intent routing + supervisor + parallel research + QA pipeline + human review. Enterprise content: простые queries напрямую, сложные reports через supervisor → parallel research → review → publish.

03 LangGraph vs CrewAI vs AutoGen и двухуровневый протокол MCP+A2A

Три multi-agent фреймворка (2026)
Измерение LangGraph CrewAI AutoGen
Парадигма State machine graph Role-based team Conversational multi-agents
State management Native Самостоятельная реализация Ограниченная поддержка
Human-in-the-Loop Native interrupt() Самостоятельная реализация Поддерживается
Production readiness Очень высокая Средняя Высокая
Быстрый прототип Средняя Очень высокая Высокая
Лучший кейс Сложные stateful workflow Role-based content pipelines Dialog collaboration / Azure stack

Выбор: production reliability, state persistence, fine HITL → LangGraph; валидация идеи за 1–2 дня → CrewAI; Microsoft/Azure, iterative debates → AutoGen.

Двухслойная протокольная архитектура (2026, Linux Foundation AAIF):

  • MCP (вертикальный слой): agent ↔ tools/DB/API. Anthropic-led; write once, use everywhere.
  • A2A (горизонтальный слой): agent ↔ agent. Google open source апрель 2025, v1.0 начало 2026; 50+ partners. Стандартизованная delegation, capability discovery, state sync; каждый agent публикует /.well-known/agent.json; orchestrator делегирует через JSON-RPC 2.0 message/send.

MCP-tools могут обрабатывать CRM- или ticket-данные; A2A traces между сервисами могут проходить через US cloud regions. Документируйте обработку персональных данных и cross-border transfer при production rollout.

a2a_delegate.py
card = await httpx.get(f"{agent_url}/.well-known/agent.json")
skills = [s["id"] for s in card.json()["skills"]]
payload = {"jsonrpc": "2.0", "method": "message/send", ...}
response = await httpx.post(agent_card["url"], json=payload)

04 Production engineering и observability: из чёрного ящика — прозрачность

Четыре столпа production:

  • State persistence и resume: LangGraph PostgresSaver как checkpoint; thread_id cross-process; restart без потери state.
  • Human-in-the-Loop: interrupt() паузит risky actions (например prod DB write) до approval.
  • Circuit breaker и retry: threshold → OPEN; после timeout HALF_OPEN; external agent calls всегда wrap.
  • Token budget: TokenBudgetManager перед каждым call; BudgetExceededException; usage per agent.

Observability (MAST analysis по 1642 traces):

Распределение сбоев multi-agent систем
Тип сбоя Доля Типичные симптомы
System design 41,77 % Повтор шагов, неверные tools, context overflow, нет stop condition
Agent misalignment 36,94 % Потеря context при handoff; hallucination становится «фактом» для следующего agent
Task validation failure 21,30 % Early termination, incomplete validation

57 % организаций уже имеют agents в production, только 8 % внедрили LLM observability — ошибки приходят как HTTP 200, dashboards зелёные. Ответ: OpenTelemetry с correlation_id, core metrics (success rate >85 %, P95 <30 s, agent error rate <5 %), LLM-as-a-Judge для completeness и hallucination rate. Traces могут содержать персональные prompt-данные — задайте retention и access policy.

05 Типичные ловушки, защита и дерево решений

  • Context pollution: hallucination от A доходит до B и C; HTTP 200 всё равно. Защита: schema validation на handoffs, confidence <0,7 reject, required fields.
  • Infinite loops и cost explosion: retry/tool spirals. Защита: MAX_ITERATIONS=10, MAX_TOOL_CALLS_PER_AGENT=20, MAX_TOTAL_TOKENS=50_000; interrupt_before перед costly tools.
  • Over-engineering: двухшаговая chain разбита на восемь agents. Правило: начинать с pipeline; в production обычно 3–8 agents.
  • Demo-production gap: edge inputs каскадируют. Защита: ProductionGuardrails — length limit, prompt injection, PII filter, harmful content classification.
  • Parallel branch sync (LangGraph): Send branches разной длины; supervisor перезапускается рано. Защита: builder.add_node("supervisor", supervisor_node, defer=True).

Дерево решений: strict linear dependency → parallel possible? Нет → pipeline; Да → fan-out + pipeline. No linearity → decision authority? Да → subteams needed? Нет → supervisor-worker; Да → hierarchical supervisor. No authority → long async? Да → blackboard; Нет → agents ≤5 с clear stop? Да → swarm с hard round limit; Нет → restructure в hierarchy.

Тренды 2026: federated orchestration, multimodal multi-agents, adaptive topology (AdaptOrch), EU AI Act с полной decision audit chain.

06 Цитируемые данные, rollout в шесть шагов и CALMVPS wrap-up

  • Google Agent Bake-Off (MLflow 2026): distributed multi-agent architecture с 1 часа до 10 минут — более чем 6× быстрее.
  • AdaptOrch (arXiv 2602.16873): правильная topology даёт 12–23 % на SWE-bench — сильнее выбора модели.
  • MAST: 1642 traces — system design 41,77 %, misalignment 36,94 %; 57 % в production, 8 % observability.
  • A2A v1.0 (2026): 50+ enterprise partners; JSON-RPC 2.0 over HTTP; Agent Card как de-facto standard.

Официальная документация (перепроверьте ссылки после release):

https://langchain-ai.github.io/langgraph/

https://docs.crewai.com

https://microsoft.github.io/autogen/

https://modelcontextprotocol.io

https://github.com/google/A2A

  1. Pipeline как proof: LangGraph или CrewAI — 3-step chain (retrieval → analysis → output); расширять только если single agent реально не справляется.
  2. Выбрать topology и framework: decision tree; compliance (finance/health) → LangGraph; fast prototype → CrewAI; Azure → AutoGen.
  3. MCP tool layer и A2A: MCP Server per worker; cross-service через Agent Card + JSON-RPC.
  4. Production guardrails: Postgres checkpoints, token budget, circuit breaker, schema на handoffs, hard loop limits.
  5. Deploy observability: OpenTelemetry, metric alerts, LLM-as-Judge sampling; target success rate >85 %.
  6. Deploy 24/7: sleep ноутбука ломает long workflows; plain Linux VPS без macOS sandboxes и Xcode. Для stable multi-agent orchestration, MCP infra и iOS CI CALMVPS bare-metal Mac rental обычно лучший fit: dedicated M4/M4 Pro, ~120s provisioning, flexible day/week/month/quarter billing. См. цены и центр помощи.

Multi-agent architecture — не про количество agents, а про topology, protocols и observability. MCP + A2A — будущий стандарт; orchestration > model choice — начните с three-node pipeline и расширяйте по evidence.