SAS
Single-Agent
Один агент решает задачу целиком.
Визуальный конспект «Towards a Science of Scaling Agent Systems»: как структура задачи, инструменты и цена координации определяют пользу MAS.
Масштабировать нужно не число агентов, а соответствие задачи и координации. Декомпозируемость, исходный результат одного агента и стоимость взаимодействия важнее размера команды.
MAS выигрывает там, где работу можно разделить на параллельные потоки. Жёстко последовательная задача превращает координацию в помеху.
Centralized дала +80,8% на Finance-Agent. Independent потеряла 70,0% на Plancraft. Универсального победителя нет.
После 3–4 агентов фиксированный бюджет делится между участниками, и каждому остаётся меньше ресурса на рассуждение. Больше сообщений уже не гарантирует лучший ответ.
Авторы сравнивают single-agent system (SAS) и multi-agent system (MAS) как инженерные архитектуры. Результат определяет структура работы, а не число ролей.
Параллельный анализ и независимый поиск позволяют распределить работу. Промежуточный контекст всё равно сжимается в сообщения, поэтому проверку нужно проектировать отдельно.
Последовательные зависимости требуют единого состояния. Разделение контекста создаёт ошибки передачи и дублирование.
Промпты, инструменты и вычислительный бюджет выровнены. Меняются возможности базовой модели и архитектура координации, поэтому эффект MAS можно отделить от эффекта дополнительного compute.
Архитектура задаёт, кто видит промежуточные результаты, кто распределяет работу и как принимается итоговое решение. Одинаковое число агентов может дать разную динамику ошибок.
SAS
Один агент решает задачу целиком.
Independent
Параллельная работа без peer-сообщений.
Centralized
Оркестратор управляет подагентами.
Decentralized
Peer-связи и majority voting.
Hybrid
Оркестратор плюс прямой обмен.
Шесть бенчмарков проверяют разные режимы: параллельный поиск, количественный анализ, вызовы инструментов, последовательное планирование и итеративную отладку.
| Бенчмарк | Структура работы | Лучший или показательный MAS-результат |
|---|---|---|
| Finance-Agent | Многошаговый количественный анализ и оценка рисков; работа делится на информационные потоки. | Centralized +80,8% |
| BrowseComp-Plus | Веб-навигация, извлечение и синтез данных с нескольких страниц. | Decentralized +9,2% |
| WorkBench | Последовательности function calls, 16 инструментов, outcome и exact-match. | Decentralized +5,6% |
| Terminal-Bench | CLI-задачи по администрированию, безопасности и ML; два инструмента. | Independent +1,7% |
| SWE-bench Verified | Исправление GitHub issues, тесты и итеративная отладка; семь инструментов. | Все MAS: −2,1…−14,9% |
| Plancraft | Строгое планирование в Minecraft: ресурсы, зависимости и порядок действий. | Все MAS хуже; до −70,0% |
Finance-Agent позволяет разнести сбор и анализ информации. Centralized-топология превзошла SAS baseline на 80,8%.
В Plancraft следующий шаг зависит от единого состояния. Разделение контекста нарушает цепочку решений, поэтому проигрывают все MAS.
Одна топология меняет знак в зависимости от домена. Разброс от +80,8% до −70,0% показывает, как усреднение «MAS против SAS» скрывает смену знака.
Figure 2 · из статьи
| Сценарий | SAS | MAS | Изменение |
|---|---|---|---|
| Finance-Agent · Centralized | 0,349 | 0,631 | +80,8% |
| BrowseComp-Plus · Decentralized | 0,318 | 0,347 | +9,2% |
| WorkBench · Decentralized | 0,629 | 0,664 | +5,6% |
| Terminal-Bench · Independent | 0,344 | 0,350 | +1,7% |
| SWE-bench Verified · Hybrid | 0,522 | 0,511 | −2,1% |
| Plancraft · Independent | 0,568 | 0,170 | −70,0% |
Регрессия связывает пользу MAS с силой базового агента, числом инструментов и динамикой ошибок. Один фактор подтверждён устойчивее остальных.
При результате SAS выше примерно 45% в этой выборке MAS чаще даёт отрицательную отдачу. Взаимодействие baseline×agents: β = −0,236, p = 0,004.
В tool-heavy средах снижение эффективности MAS сильнее штрафует результат: β = −0,096. После кластеризации стандартных ошибок по наборам данных эффект теряет значимость: p = 0,205.
Архитектуры с проверкой промежуточных ответов могут сдерживать распространение ошибок. Польза зависит от трассы, а не от самого факта общения.
Figure 6 · robustness
Больше агентов означает больше ходов, токенов и точек передачи ошибки. Поэтому performance без стоимости даёт неполную картину.
Figure 3 · cost/performance
| Архитектура | Ходы | Overhead | Success / 1K tokens | Trace-error amp. |
|---|---|---|---|---|
| SAS | 7,2 | 0% | 67,7 | 1,0 |
| Independent | 11,4 | 58% | 42,4 | 17,2 |
| Decentralized | 26,1 | 263% | 23,9 | 7,8 |
| Centralized | 27,7 | 285% | 21,5 | 4,4 |
| Hybrid | 44,3 | 515% | 13,6 | 5,1 |
Регрессия объясняет часть абсолютного результата, но лучше ранжирует архитектуры внутри новой конфигурации. Авторы рекомендуют Agentic Capability Index (ACI) вместо общего Intelligence Index.
Авторы проверяют устойчивость результатов и прямо фиксируют границы. Наблюдаемый порог нельзя превращать в универсальный закон.
Стандартные ошибки кластеризованы всего по шести наборам данных. Часть коэффициентов теряет статистическую значимость.
На BrowseComp-Plus вне обучающего диапазона модель выбирала Hybrid во всех трёх случаях и переоценивала её результат на 37%.
Одинаковый Intelligence Index не делает модели эквивалентными. При Index 75 SAS дала 0,45 у GPT-5.2 и 0,36/0,34 у Gemini-3.0 Pro и Gemini-3.0 Flash.
Исследованы канонические текстовые топологии до девяти агентов. Промпты не оптимизировали под семейства; embodied, multimodal и long-horizon системы не проверялись.
Каждый пункт открывает соответствующий раздел arXiv. Миниатюры ведут к фигурам, на которых построен конспект.
Почему соответствие координации и задачи важнее числа агентов.
Figure 1
Формальные определения SAS, MAS, communication и coordination.
Шесть задач, их инструменты, зависимости и метрики успеха.
Доменные выигрыши и потери, взаимодействие топологии с семейством LLM.
Figure 2
Figure 3
Baseline ceiling, tool-tax и механизмы распространения ошибок.
Ходы, overhead, токены, плотность сообщений и ошибки трассы.
Статистические проверки, внешняя валидация и границы переноса.
Используйте выводы как последовательность измерений. Чек-лист сужает поиск; финальный выбор проверьте на своей задаче.