● Исследование · arXiv:2512.08296v3 · 08.04.2026

Когда команда агентов лучше одного, а когда хуже

Визуальный конспект «Towards a Science of Scaling Agent Systems»: как структура задачи, инструменты и цена координации определяют пользу MAS.

✍️ Yubin Kim и 19 соавторов 📅 8 апреля 2026 ~172 мин 🧪 260 конфигураций
Главный тезис

Масштабировать нужно не число агентов, а соответствие задачи и координации. Декомпозируемость, исходный результат одного агента и стоимость взаимодействия важнее размера команды.

Графики производительности пяти агентных топологий в трёх семействах LLM
Figure 1: общий рисунок исследования · открыть в статье ↗
TL;DR

Суть за минуту

abstract

Соответствие важнее масштаба

MAS выигрывает там, где работу можно разделить на параллельные потоки. Жёстко последовательная задача превращает координацию в помеху.

±От +80,8% до −70,0%

Centralized дала +80,8% на Finance-Agent. Independent потеряла 70,0% на Plancraft. Универсального победителя нет.

Координация быстро дорожает

После 3–4 агентов фиксированный бюджет делится между участниками, и каждому остаётся меньше ресурса на рассуждение. Больше сообщений уже не гарантирует лучший ответ.

01

Вопрос исследования: когда MAS оправдана

в статье

Авторы сравнивают single-agent system (SAS) и multi-agent system (MAS) как инженерные архитектуры. Результат определяет структура работы, а не число ролей.

Сначала SAS низкий baseline, но задача плохо делится Тестировать MAS низкий baseline и независимые потоки работы Оставить SAS сильный baseline, координация съедает запас Сравнить стоимость параллелизм есть, но прирост может не окупить overhead декомпозируемость задачи → результат SAS →
Схема конспекта: решение начинается с задачи и baseline

Где появляется запас

Параллельный анализ и независимый поиск позволяют распределить работу. Промежуточный контекст всё равно сжимается в сообщения, поэтому проверку нужно проектировать отдельно.

Где команда мешает

Последовательные зависимости требуют единого состояния. Разделение контекста создаёт ошибки передачи и дублирование.

Граница: порог и выбор топологии получены в этом экспериментальном дизайне. Используйте их как диагностические ориентиры; универсальной гарантии нет.
02

Контроль переменных: что зафиксировали

4.1 Setup

Промпты, инструменты и вычислительный бюджет выровнены. Меняются возможности базовой модели и архитектура координации, поэтому эффект MAS можно отделить от эффекта дополнительного compute.

260
экспериментальных конфигураций
6
бенчмарков разной структуры
5
топологий, включая SAS
3
семейства LLM
Задача 6 бенчмарков разная структура Базовая LLM OpenAI · Gemini Claude Топология SAS · Independent Centralized · Decentralized Hybrid Метрики успех стоимость · ошибки одинаковые prompts · tools · compute budget
Контролируемый дизайн отделяет архитектуру от силы модели
03

Пять топологий: обмен сообщениями ещё не координация

3.1 System Definition

Архитектура задаёт, кто видит промежуточные результаты, кто распределяет работу и как принимается итоговое решение. Одинаковое число агентов может дать разную динамику ошибок.

Схема одного агента в SAS SAS

Single-Agent

Один агент решает задачу целиком.

Схема независимых агентов и агрегатора Independent

Independent

Параллельная работа без peer-сообщений.

Схема централизованной MAS с оркестратором Centralized

Centralized

Оркестратор управляет подагентами.

Схема децентрализованной MAS и голосования Decentralized

Decentralized

Peer-связи и majority voting.

Схема гибридной MAS с оркестратором и peer-связью Hybrid

Hybrid

Оркестратор плюс прямой обмен.

Различие: communication описывает передачу сообщений. Coordination описывает разделение работы, управление зависимостями и сведение результата. Больше communication не означает лучшее coordination.
04

Структура задачи меняет знак эффекта

3.2 Benchmarks

Шесть бенчмарков проверяют разные режимы: параллельный поиск, количественный анализ, вызовы инструментов, последовательное планирование и итеративную отладку.

БенчмаркСтруктура работыЛучший или показательный MAS-результат
Finance-AgentМногошаговый количественный анализ и оценка рисков; работа делится на информационные потоки.Centralized +80,8%
BrowseComp-PlusВеб-навигация, извлечение и синтез данных с нескольких страниц.Decentralized +9,2%
WorkBenchПоследовательности function calls, 16 инструментов, outcome и exact-match.Decentralized +5,6%
Terminal-BenchCLI-задачи по администрированию, безопасности и ML; два инструмента.Independent +1,7%
SWE-bench VerifiedИсправление GitHub issues, тесты и итеративная отладка; семь инструментов.Все MAS: −2,1…−14,9%
PlancraftСтрогое планирование в Minecraft: ресурсы, зависимости и порядок действий.Все MAS хуже; до −70,0%

Параллелизм помогает

Finance-Agent позволяет разнести сбор и анализ информации. Centralized-топология превзошла SAS baseline на 80,8%.

Последовательность наказывает

В Plancraft следующий шаг зависит от единого состояния. Разделение контекста нарушает цепочку решений, поэтому проигрывают все MAS.

05

Одна MAS не подходит всем задачам

4.2 Main Results

Одна топология меняет знак в зависимости от домена. Разброс от +80,8% до −70,0% показывает, как усреднение «MAS против SAS» скрывает смену знака.

Шесть boxplot-графиков результатов SAS и MAS с процентными аннотациями по бенчмаркам Figure 2 · из статьи
Что показано: абсолютные accuracy или success rate для SAS и четырёх MAS-топологий. Проценты над панелями отмечают изменение относительно SAS.
СценарийSASMASИзменение
Finance-Agent · Centralized0,3490,631+80,8%
BrowseComp-Plus · Decentralized0,3180,347+9,2%
WorkBench · Decentralized0,6290,664+5,6%
Terminal-Bench · Independent0,3440,350+1,7%
SWE-bench Verified · Hybrid0,5220,511−2,1%
Plancraft · Independent0,5680,170−70,0%
06

Три закономерности масштабирования

4.3 Scaling principles

Регрессия связывает пользу MAS с силой базового агента, числом инструментов и динамикой ошибок. Один фактор подтверждён устойчивее остальных.

45Потолок baseline

При результате SAS выше примерно 45% в этой выборке MAS чаще даёт отрицательную отдачу. Взаимодействие baseline×agents: β = −0,236, p = 0,004.

16Tool-tax

В tool-heavy средах снижение эффективности MAS сильнее штрафует результат: β = −0,096. После кластеризации стандартных ошибок по наборам данных эффект теряет значимость: p = 0,205.

Верификация

Архитектуры с проверкой промежуточных ответов могут сдерживать распространение ошибок. Польза зависит от трассы, а не от самого факта общения.

ΔMAS = f(baseline, tools, topology, task)
Статистическая оговорка: наборов данных всего шесть. Порог baseline устойчив после кластеризации стандартных ошибок и Holm-поправки, а tool-tax и эффект intelligence при кластеризации слабее.
Шесть графиков динамики SAS и MAS по Intelligence Index Figure 6 · robustness
Что показано: рост возможностей модели меняет результат, но не создаёт одну лучшую архитектуру для всех задач.
07

Цена координации растёт быстрее команды

4.4 Coordination

Больше агентов означает больше ходов, токенов и точек передачи ошибки. Поэтому performance без стоимости даёт неполную картину.

Три scatter plot стоимости и производительности агентных архитектур Figure 3 · cost/performance
Что показано: стоимость и результат зависят ещё и от семейства LLM; переносить выбор топологии между вендорами рискованно.
T = 2,72 × (n + 0,5)^1,724 R² = 0,974 число агентов n → число ходов T → messages насыщаются около 0,39 msg/turn
Схема конспекта: coordination overhead растёт нелинейно
АрхитектураХодыOverheadSuccess / 1K tokensTrace-error amp.
SAS7,20%67,71,0
Independent11,458%42,417,2
Decentralized26,1263%23,97,8
Centralized27,7285%21,54,4
Hybrid44,3515%13,65,1
Рабочая зона исследования: выигрыш чаще появлялся при overhead порядка 200–300%. Hybrid тратила 515% и не становилась универсальным лидером.
08

Модель полезнее для выбора, чем для прогноза

regression model

Регрессия объясняет часть абсолютного результата, но лучше ранжирует архитектуры внутри новой конфигурации. Авторы рекомендуют Agentic Capability Index (ACI) вместо общего Intelligence Index.

0,413
5-fold CV R² с ACI
0,373
5-fold CV R² с Intelligence Index
87%
верный выбор топологии на отложенных конфигурациях
54%
baseline только по силе модели
Измерить SAS baseline · tokens · errors Описать задачу D · tools · sequence Сравнить топологии SAS · Centralized Decentralized · другие Валидировать на своих traces модель сужает поиск, эксперимент принимает решение
Относительный ranking устойчивее абсолютного прогноза
09

Где выводы могут не перенестись

Cross-domain generalization

Авторы проверяют устойчивость результатов и прямо фиксируют границы. Наблюдаемый порог нельзя превращать в универсальный закон.

Шесть кластеров

Стандартные ошибки кластеризованы всего по шести наборам данных. Часть коэффициентов теряет статистическую значимость.

Внешняя проверка

На BrowseComp-Plus вне обучающего диапазона модель выбирала Hybrid во всех трёх случаях и переоценивала её результат на 37%.

Индексы между вендорами

Одинаковый Intelligence Index не делает модели эквивалентными. При Index 75 SAS дала 0,45 у GPT-5.2 и 0,36/0,34 у Gemini-3.0 Pro и Gemini-3.0 Flash.

Ограниченный класс систем

Исследованы канонические текстовые топологии до девяти агентов. Промпты не оптимизировали под семейства; embodied, multimodal и long-horizon системы не проверялись.

Ещё одна граница: сложность задачи частично калибрована по наблюдаемой деградации MAS. Finance-Agent и Plancraft имеют близкую оценку сложности, но противоположный эффект. Декомпозируемость объясняет разницу лучше одного скаляра.

Структура статьи

оригинал

Каждый пункт открывает соответствующий раздел arXiv. Миниатюры ведут к фигурам, на которых построен конспект.

Abstract и главный тезис

читать ↗

Почему соответствие координации и задачи важнее числа агентов.

Миниатюра общего графика исследованияFigure 1

System Definition

читать ↗

Формальные определения SAS, MAS, communication и coordination.

Agentic Tasks and Benchmarks

читать ↗

Шесть задач, их инструменты, зависимости и метрики успеха.

Main Results

читать ↗

Доменные выигрыши и потери, взаимодействие топологии с семейством LLM.

Миниатюра boxplot-графиков по бенчмаркамFigure 2
Миниатюра графиков стоимости и производительностиFigure 3

Scaling Principles

читать ↗

Baseline ceiling, tool-tax и механизмы распространения ошибок.

Coordination Efficiency

читать ↗

Ходы, overhead, токены, плотность сообщений и ошибки трассы.

Robustness and Limitations

читать ↗

Статистические проверки, внешняя валидация и границы переноса.

Две формулировки авторов

Abstract
«Agent effectiveness depends on alignment between coordination and task structure.»
Эффективность задаёт соответствие механизма координации структуре работы. в статье ↗
«architecture-task alignment, not number of agents, determines collaborative success.»
Главная переменная: пара «архитектура + задача». в статье ↗
#

В цифрах

источник чисел
+80,8%
лучший доменный прирост ↗
−70,0%
худшая доменная деградация ↗
3–4
агента до ресурсного потолка ↗
0,39
насыщение messages / turn ↗

Как применить

architecture selection

Используйте выводы как последовательность измерений. Чек-лист сужает поиск; финальный выбор проверьте на своей задаче.

Зафиксируйте SAS baseline: success, tokens, ходы и ошибки трассы на том же промпте и наборе инструментов.
Опишите структуру: что можно исполнять параллельно, какие шаги зависят от единого состояния, сколько tools нужно удерживать.
При baseline около 45% и выше начните с SAS: в исследовании пространство для выигрыша MAS здесь обычно исчезало.
Для параллельного анализа тестируйте Centralized: оркестратор полезен, когда независимые потоки нужно свести в один ответ.
Для tool-heavy задач сравните Decentralized: WorkBench выиграла 5,6%, но после кластеризации по набору данных tool-tax имеет p = 0,205. Нужна локальная проверка.
Считайте полную цену: overhead, success/1K tokens, message density, redundancy и trace-error amplification, а не только accuracy.
Стоп-сигнал: если задача похожа на строгую constraint satisfaction с последовательным состоянием, сначала улучшайте single-agent loop. Plancraft показал деградацию всех MAS.

Ссылки и понятия

arXiv

// понятия исследования

SASSingle-Agent System: один агент держит задачу и контекст.
MASMulti-Agent System: несколько агентов с заданной топологией координации.
ACIAgentic Capability Index: показатель, лучше связанный с работой агента, чем общий Intelligence Index.
Trace-error amp.Усиление ошибок по трассе взаимодействия относительно SAS.
декомпозируемость верификация последовательная зависимость coordination overhead
Авторы: Yubin Kim, Ken Gu, Chanwoo Park, Chunjong Park, Samuel Schmidgall, A. Ali Heydari, Yao Yan, Zhihan Zhang, Yuchen Zhuang, Yun Liu, Mark Malhotra, Paul Pu Liang, Hae Won Park, Yuzhe Yang, Xuhai Xu, Yilun Du, Shwetak Patel, Tim Althoff, Daniel McDuff, Xin Liu.
× Увеличенная фигура из статьи
Открыть в статье