В 2024–2025 AI agents вышли из лаборатории в production — но многие команды быстро понимают: один LLM на все задачи ломается при масштабировании. Ответ — архитектура multi-agent collaboration (MAS). Внутренний Agent Bake-Off Google сократил время обработки с часа до десяти минут; AdaptOrch (2026) показывает, что топология оркестрации важнее базовой модели — прирост 12–23 %.
Гайд для AI-инженеров, backend-архитекторов и tech lead. Охватывает основы MAS, шесть паттернов оркестрации, LangGraph/CrewAI/AutoGen, MCP+A2A, production-практики, observability и типичные ловушки. После прочтения вы сможете спроектировать топологию, выбрать фреймворк и составить rollout в шесть шагов.
01 Почему одного agent недостаточно: боли и базовые концепции MAS
Боли: монолитный agent упирается в структурные потолки — не в слабость модели.
- Потолок context window: промежуточные результаты заполняют контекст; качество рассуждений падает.
- Размывание экспертизы: один agent на retrieval, код и review — всё посредственно.
- Последовательное выполнение: subtasks по очереди; общее время = сумма шагов.
- Single point of failure: ошибка одного agent останавливает всю цепочку.
Multi-agent system (MAS) — несколько независимых AI agents, работающих через явные протоколы и оркестрацию. Каждый agent должен быть ролевым, с доступом к tools, изолированным state и заменяемостью.
| Топология | Плюсы | Минусы | Типичные сценарии |
|---|---|---|---|
| Централизованная | Аудируемость, контроль | Узкое место orchestrator | Compliance, финриски |
| Децентрализованная | Высокая эластичность, низкая latency | Сложный debug, non-determinism | Debate code review |
| Иерархическая | Баланс контроля и эластичности | Средняя сложность design | Enterprise support, Replit assistant |
Вывод AdaptOrch: организация collaboration agents влияет на результат сильнее, чем выбор базовой модели.
02 Шесть паттернов оркестрации (покрывают ~95 % production)
Паттерн 1 — Sequential pipeline: выход A напрямую в B; строго линейно. Для жёстких зависимостей (контент, code review). LangGraph: StateGraph retriever → analyzer → writer; время = сумма шагов; предсказуемо и аудируемо.
from langgraph.graph import StateGraph, START, END
builder = StateGraph(PipelineState)
builder.add_node("retriever", retrieval_agent)
builder.add_node("analyzer", analysis_agent)
builder.add_node("writer", writer_agent)
builder.add_edge(START, "retriever")
builder.add_edge("retriever", "analyzer")
builder.add_edge("analyzer", "writer")
builder.add_edge("writer", END)
pipeline = builder.compile()
Паттерн 2 — Parallel fan-out/fan-in: независимые subtasks параллельно; merge-узел объединяет. Время = max(T1, T2, …, Tn). LangGraph Send API возвращает списки Send; Annotated[list, operator.add] как reducer агрегирует без ручных lock.
Паттерн 3 — Hierarchical supervisor-worker: supervisor для intent, декомпозиции и routing; workers для domain-задач; synthesizer для сводки. Рекомендуется двухуровневый routing — keyword fast path (<1 ms, без LLM) + LLM routing для vague intent.
Паттерн 4 — Swarm/network: peer-to-peer без central coordinator; остановка по rounds, consensus или timeout. Для multi-round debate; в production осторожно — AutoGen GroupChat требует жёсткий max_round.
Паттерн 5 — Blackboard: общее structured workspace; agents читают/пишут при выполнении условий без явного scheduler. Для часовых/суточных async workflow и heterogeneous teams.
Паттерн 6 — Hybrid: комбинация паттернов — типично intent routing + supervisor + parallel research + QA pipeline + human review. Enterprise content: простые queries напрямую, сложные reports через supervisor → parallel research → review → publish.
03 LangGraph vs CrewAI vs AutoGen и двухуровневый протокол MCP+A2A
| Измерение | LangGraph | CrewAI | AutoGen |
|---|---|---|---|
| Парадигма | State machine graph | Role-based team | Conversational multi-agents |
| State management | Native | Самостоятельная реализация | Ограниченная поддержка |
| Human-in-the-Loop | Native interrupt() |
Самостоятельная реализация | Поддерживается |
| Production readiness | Очень высокая | Средняя | Высокая |
| Быстрый прототип | Средняя | Очень высокая | Высокая |
| Лучший кейс | Сложные stateful workflow | Role-based content pipelines | Dialog collaboration / Azure stack |
Выбор: production reliability, state persistence, fine HITL → LangGraph; валидация идеи за 1–2 дня → CrewAI; Microsoft/Azure, iterative debates → AutoGen.
Двухслойная протокольная архитектура (2026, Linux Foundation AAIF):
- MCP (вертикальный слой): agent ↔ tools/DB/API. Anthropic-led; write once, use everywhere.
- A2A (горизонтальный слой): agent ↔ agent. Google open source апрель 2025, v1.0 начало 2026; 50+ partners. Стандартизованная delegation, capability discovery, state sync; каждый agent публикует
/.well-known/agent.json; orchestrator делегирует через JSON-RPC 2.0message/send.
MCP-tools могут обрабатывать CRM- или ticket-данные; A2A traces между сервисами могут проходить через US cloud regions. Документируйте обработку персональных данных и cross-border transfer при production rollout.
card = await httpx.get(f"{agent_url}/.well-known/agent.json")
skills = [s["id"] for s in card.json()["skills"]]
payload = {"jsonrpc": "2.0", "method": "message/send", ...}
response = await httpx.post(agent_card["url"], json=payload)
04 Production engineering и observability: из чёрного ящика — прозрачность
Четыре столпа production:
- State persistence и resume: LangGraph
PostgresSaverкак checkpoint;thread_idcross-process; restart без потери state. - Human-in-the-Loop:
interrupt()паузит risky actions (например prod DB write) до approval. - Circuit breaker и retry: threshold → OPEN; после timeout HALF_OPEN; external agent calls всегда wrap.
- Token budget:
TokenBudgetManagerперед каждым call;BudgetExceededException; usage per agent.
Observability (MAST analysis по 1642 traces):
| Тип сбоя | Доля | Типичные симптомы |
|---|---|---|
| System design | 41,77 % | Повтор шагов, неверные tools, context overflow, нет stop condition |
| Agent misalignment | 36,94 % | Потеря context при handoff; hallucination становится «фактом» для следующего agent |
| Task validation failure | 21,30 % | Early termination, incomplete validation |
57 % организаций уже имеют agents в production, только 8 % внедрили LLM observability — ошибки приходят как HTTP 200, dashboards зелёные. Ответ: OpenTelemetry с correlation_id, core metrics (success rate >85 %, P95 <30 s, agent error rate <5 %), LLM-as-a-Judge для completeness и hallucination rate. Traces могут содержать персональные prompt-данные — задайте retention и access policy.
05 Типичные ловушки, защита и дерево решений
- Context pollution: hallucination от A доходит до B и C; HTTP 200 всё равно. Защита: schema validation на handoffs, confidence <0,7 reject, required fields.
- Infinite loops и cost explosion: retry/tool spirals. Защита:
MAX_ITERATIONS=10,MAX_TOOL_CALLS_PER_AGENT=20,MAX_TOTAL_TOKENS=50_000;interrupt_beforeперед costly tools. - Over-engineering: двухшаговая chain разбита на восемь agents. Правило: начинать с pipeline; в production обычно 3–8 agents.
- Demo-production gap: edge inputs каскадируют. Защита:
ProductionGuardrails— length limit, prompt injection, PII filter, harmful content classification. - Parallel branch sync (LangGraph): Send branches разной длины; supervisor перезапускается рано. Защита:
builder.add_node("supervisor", supervisor_node, defer=True).
Дерево решений: strict linear dependency → parallel possible? Нет → pipeline; Да → fan-out + pipeline. No linearity → decision authority? Да → subteams needed? Нет → supervisor-worker; Да → hierarchical supervisor. No authority → long async? Да → blackboard; Нет → agents ≤5 с clear stop? Да → swarm с hard round limit; Нет → restructure в hierarchy.
Тренды 2026: federated orchestration, multimodal multi-agents, adaptive topology (AdaptOrch), EU AI Act с полной decision audit chain.
06 Цитируемые данные, rollout в шесть шагов и CALMVPS wrap-up
- Google Agent Bake-Off (MLflow 2026): distributed multi-agent architecture с 1 часа до 10 минут — более чем 6× быстрее.
- AdaptOrch (arXiv 2602.16873): правильная topology даёт 12–23 % на SWE-bench — сильнее выбора модели.
- MAST: 1642 traces — system design 41,77 %, misalignment 36,94 %; 57 % в production, 8 % observability.
- A2A v1.0 (2026): 50+ enterprise partners; JSON-RPC 2.0 over HTTP; Agent Card как de-facto standard.
Официальная документация (перепроверьте ссылки после release):
https://langchain-ai.github.io/langgraph/
https://microsoft.github.io/autogen/
https://modelcontextprotocol.io
- Pipeline как proof: LangGraph или CrewAI — 3-step chain (retrieval → analysis → output); расширять только если single agent реально не справляется.
- Выбрать topology и framework: decision tree; compliance (finance/health) → LangGraph; fast prototype → CrewAI; Azure → AutoGen.
- MCP tool layer и A2A: MCP Server per worker; cross-service через Agent Card + JSON-RPC.
- Production guardrails: Postgres checkpoints, token budget, circuit breaker, schema на handoffs, hard loop limits.
- Deploy observability: OpenTelemetry, metric alerts, LLM-as-Judge sampling; target success rate >85 %.
- Deploy 24/7: sleep ноутбука ломает long workflows; plain Linux VPS без macOS sandboxes и Xcode. Для stable multi-agent orchestration, MCP infra и iOS CI CALMVPS bare-metal Mac rental обычно лучший fit: dedicated M4/M4 Pro, ~120s provisioning, flexible day/week/month/quarter billing. См. цены и центр помощи.
Multi-agent architecture — не про количество agents, а про topology, protocols и observability. MCP + A2A — будущий стандарт; orchestration > model choice — начните с three-node pipeline и расширяйте по evidence.