Cinque agent Gemini 3.5 Flash che lavorano insieme in tempo reale hanno risolto l'87% di un set di 30 problemi di Project Euler, superando i cinque agent che operavano singolarmente (72%) e entrambi i baseline basati sulla maggioranza (80% in modalità singola, 90% in modalità collaborativa). L'esecuzione collaborativa ha inoltre ridotto di quattro minuti il tempo medio di esecuzione, passando da 14 minuti per problema a 10 minuti, con la maggior parte delle soluzioni ottenute in meno di cinque minuti.
Perché l'esperimento è importante
Gli assistenti di programmazione basati su IA già scrivono snippet di codice, effettuano il debug e generano interi programmi. Di solito, i ricercatori testano un singolo modello su un prompt e valutano la sua risposta. Questo test pone una domanda diversa: un gruppo di agent che condividono le scoperte durante il lavoro può superare un approccio basato sulla "saggezza della folla" che si limita a conteggiare risposte indipendenti?
I problemi di Project Euler fungono da benchmark standard per il pensiero algoritmico. Combinano intuizione matematica e programmazione efficiente, rendendoli un ottimo sostituto per i compiti di programmazione del mondo reale, dove correttezza e velocità sono fondamentali.
Come è stato impostato il test
- Agent: Cinque istanze di Gemini 3.5 Flash accessibili tramite la piattaforma Antigravity.
- Scenari:
- Ogni agent ha affrontato ogni problema da solo, riportando la propria risposta.
- Gli stessi cinque agent hanno collaborato in tempo reale, trasmettendo i risultati intermedi e confermando i passaggi reciproci.
- Per entrambi i setup, un semplice aggregatore basato sulla maggioranza ha combinato le cinque risposte indipendenti.
- Metriche: Accuratezza (percentuale di risposte corrette) e tempo di esecuzione (tempo medio per problema, oltre alla distribuzione dei tempi di completamento).
Cosa rivelano i numeri
- Accuratezza singola: 72 %
- Accuratezza collaborativa: 87 %
- Accuratezza singola tramite maggioranza: 80 %
- Accuratezza collaborativa tramite maggioranza: 90 %
Il tempo di esecuzione è sceso da una media di 14 minuti per gli agent singoli a 10 minuti per il gruppo collaborativo. La maggior parte delle esecuzioni collaborative si è conclusa in meno di cinque minuti, mentre i tentativi singoli hanno spesso raggiunto il limite di timeout di 30 minuti.
Osservazioni chiave che spiegano il divario
- Impossibile per uno, possibile per molti – Su un singolo problema tutti gli agent singoli sono falliti, eppure il team collaborativo ha scambiato risultati parziali e, collettivamente, è arrivato alla risposta corretta.
- Rilevamento degli errori tramite verifica incrociata – I singoli agent a volte sono caduti in trappole logiche; il gruppo ha colto questi errori confrontando le informazioni in tempo reale.
- Rapida convergenza – Quando un agent scopriva un valore intermedio cruciale, lo trasmetteva, permettendo agli altri di saltare il lavoro ridondante e di convergere più velocemente sulla soluzione finale.
I costi e i limiti nascosti
L'esperimento ha utilizzato solo cinque agent; non è ancora chiaro se la stessa efficienza sia scalabile a decine o centinaia di agent. Inoltre, l'aggregatore basato sulla maggioranza ha comunque ottenuto ottimi risultati (90% con la collaborazione).
Cosa osservare in futuro
- Esperimenti di scalabilità – Cento agent miglioreranno ancora l'accuratezza o prevarrà il sovraccarico di coordinamento?
- Specializzazione dei ruoli – Assegnare compiti specifici (ad esempio, un agent si concentra sulla teoria dei numeri, un altro sull'ottimizzazione) potrebbe amplificare i benefici rispetto alla collaborazione a schema libero.
- Benchmark più ampi – Applicare lo stesso framework a sfide di generazione di codice, suite di debugging o build di software reali servirà a testare se i vantaggi si mantengono anche al di fuori dei puzzle matematici.
In sintesi
La collaborazione in tempo reale tra agent di programmazione IA può aumentare sia i tassi di successo che la velocità nei compiti algoritmici, superando i tentativi singoli e persino un semplice voto della folla. L'approccio è promettente, ma la sua scalabilità e il suo rapporto costo-efficacia rimangono questioni aperte che la ricerca futura dovrà affrontare.
Fonte: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
