Пять агентов Gemini 3.5 Flash, работающих вместе в режиме реального времени, решили 87% из 30 задач Project Euler, превзойдя пять агентов, работающих по отдельности (72%), и оба базовых сценария с голосованием большинством (80% при одиночной работе и 90% при совместной). Совместный запуск также сократил среднее время выполнения на четыре минуты: с 14 минут на задачу до 10 минут, при этом большинство решений было получено менее чем за пять минут.

Почему этот эксперимент важен

ИИ-ассистенты для написания кода уже умеют составлять фрагменты кода, отлаживать его и генерировать целые программы. Исследователи обычно тестируют одну модель на конкретном запросе и оценивают её ответ. Этот тест ставит другой вопрос: может ли группа агентов, обменивающихся результатами в процессе работы, превзойти подход «мудрости толпы», который просто суммирует независимые ответы?

Задачи Project Euler служат стандартным бенчмарком для проверки алгоритмического мышления. Они сочетают в себе математическую интуицию и эффективное программирование, что делает их хорошим прокси-показателем для реальных задач программирования, где важны точность и скорость.

Как проводилось тестирование

  • Агенты: пять экземпляров Gemini 3.5 Flash, доступ к которым осуществлялся через платформу Antigravity.
  • Сценарии:
    1. Каждый агент решал каждую задачу в одиночку, предоставляя собственный ответ.
    2. Те же пять агентов сотрудничали в режиме реального времени, транслируя промежуточные результаты и подтверждая шаги друг друга.
    3. В обоих сценариях простой агрегатор по принципу голосования большинством объединял пять независимых ответов.
  • Метрики: точность (процент правильных ответов) и время выполнения (среднее время на задачу, а также распределение времени завершения).

Что показывают цифры

  • Точность при одиночной работе: 72%
  • Точность при совместной работе: 87%
  • Точность при одиночном голосовании большинством: 80%
  • Точность при совместном голосовании большинством: 90%

Среднее время выполнения сократилось с 14 минут для одиночных агентов до 10 минут для совместной группы. Большинство совместных запусков завершались менее чем за пять минут, тогда как одиночные попытки часто достигали 30-минутного лимита ожидания (timeout).

Ключевые наблюдения, объясняющие разрыв

  • Невозможно для одного, возможно для многих — в одной задаче все одиночные агенты потерпели неудачу, однако совместная команда обменивалась частичными результатами и коллективно пришла к правильному ответу.
  • Исправление ошибок путем перекрестной проверки — отдельные агенты иногда попадали в логические ловушки; группа замечала эти ошибки, сравнивая записи в режиме реального времени.
  • Быстрая сходимость — когда любой агент находил критически важное промежуточное значение, он транслировал находку, позволяя остальным пропустить избыточную работу и быстрее прийти к окончательному решению.

Скрытые издержки и ограничения

В эксперименте использовалось всего пять агентов; пока неясно, масштабируется ли такая же эффективность на десятки или сотни участников. Более того, агрегатор по принципу голосования большинством всё равно показал хорошие результаты (90% при совместной работе).

На что стоит обратить внимание в будущем

  • Эксперименты по масштабированию — повысит ли сто агентов точность или же накладные расходы на координацию станут доминирующими?
  • Специализация ролей — распределение конкретных задач (например, один агент фокусируется на теории чисел, другой — на оптимизации) может усилить преимущества по сравнению со свободным сотрудничеством.
  • Более широкие бенчмарки — применение той же структуры к задачам генерации кода, наборам для отладки или сборке реального программного обеспечения позволит проверить, сохранятся ли преимущества за пределами математических головоломок.

Итог

Сотрудничество ИИ-агентов для написания кода в режиме реального времени может повысить как процент успеха, так и скорость решения алгоритмических задач, превосходя одиночные попытки и даже простое голосование большинства. Этот подход выглядит многообещающим, но вопросы масштабируемости и экономической эффективности остаются открытыми и требуют дальнейших исследований.

Источник: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0