Пять агентов Gemini 3.5 Flash, работающих вместе в режиме реального времени, решили 87% из 30 задач Project Euler, превзойдя пять агентов, работающих по отдельности (72%), и оба базовых сценария с голосованием большинством (80% при одиночной работе и 90% при совместной). Совместный запуск также сократил среднее время выполнения на четыре минуты: с 14 минут на задачу до 10 минут, при этом большинство решений было получено менее чем за пять минут.
Почему этот эксперимент важен
ИИ-ассистенты для написания кода уже умеют составлять фрагменты кода, отлаживать его и генерировать целые программы. Исследователи обычно тестируют одну модель на конкретном запросе и оценивают её ответ. Этот тест ставит другой вопрос: может ли группа агентов, обменивающихся результатами в процессе работы, превзойти подход «мудрости толпы», который просто суммирует независимые ответы?
Задачи Project Euler служат стандартным бенчмарком для проверки алгоритмического мышления. Они сочетают в себе математическую интуицию и эффективное программирование, что делает их хорошим прокси-показателем для реальных задач программирования, где важны точность и скорость.
Как проводилось тестирование
- Агенты: пять экземпляров Gemini 3.5 Flash, доступ к которым осуществлялся через платформу Antigravity.
- Сценарии:
- Каждый агент решал каждую задачу в одиночку, предоставляя собственный ответ.
- Те же пять агентов сотрудничали в режиме реального времени, транслируя промежуточные результаты и подтверждая шаги друг друга.
- В обоих сценариях простой агрегатор по принципу голосования большинством объединял пять независимых ответов.
- Метрики: точность (процент правильных ответов) и время выполнения (среднее время на задачу, а также распределение времени завершения).
Что показывают цифры
- Точность при одиночной работе: 72%
- Точность при совместной работе: 87%
- Точность при одиночном голосовании большинством: 80%
- Точность при совместном голосовании большинством: 90%
Среднее время выполнения сократилось с 14 минут для одиночных агентов до 10 минут для совместной группы. Большинство совместных запусков завершались менее чем за пять минут, тогда как одиночные попытки часто достигали 30-минутного лимита ожидания (timeout).
Ключевые наблюдения, объясняющие разрыв
- Невозможно для одного, возможно для многих — в одной задаче все одиночные агенты потерпели неудачу, однако совместная команда обменивалась частичными результатами и коллективно пришла к правильному ответу.
- Исправление ошибок путем перекрестной проверки — отдельные агенты иногда попадали в логические ловушки; группа замечала эти ошибки, сравнивая записи в режиме реального времени.
- Быстрая сходимость — когда любой агент находил критически важное промежуточное значение, он транслировал находку, позволяя остальным пропустить избыточную работу и быстрее прийти к окончательному решению.
Скрытые издержки и ограничения
В эксперименте использовалось всего пять агентов; пока неясно, масштабируется ли такая же эффективность на десятки или сотни участников. Более того, агрегатор по принципу голосования большинством всё равно показал хорошие результаты (90% при совместной работе).
На что стоит обратить внимание в будущем
- Эксперименты по масштабированию — повысит ли сто агентов точность или же накладные расходы на координацию станут доминирующими?
- Специализация ролей — распределение конкретных задач (например, один агент фокусируется на теории чисел, другой — на оптимизации) может усилить преимущества по сравнению со свободным сотрудничеством.
- Более широкие бенчмарки — применение той же структуры к задачам генерации кода, наборам для отладки или сборке реального программного обеспечения позволит проверить, сохранятся ли преимущества за пределами математических головоломок.
Итог
Сотрудничество ИИ-агентов для написания кода в режиме реального времени может повысить как процент успеха, так и скорость решения алгоритмических задач, превосходя одиночные попытки и даже простое голосование большинства. Этот подход выглядит многообещающим, но вопросы масштабируемости и экономической эффективности остаются открытыми и требуют дальнейших исследований.
Источник: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
