Cinque agent Gemini 3.5 Flash che lavorano insieme in tempo reale hanno risolto l'87% di un set di 30 problemi di Project Euler, superando i cinque agent che operavano singolarmente (72%) e entrambi i baseline basati sulla maggioranza (80% in modalità singola, 90% in modalità collaborativa). L'esecuzione collaborativa ha inoltre ridotto di quattro minuti il tempo medio di esecuzione, passando da 14 minuti per problema a 10 minuti, con la maggior parte delle soluzioni ottenute in meno di cinque minuti.

Perché l'esperimento è importante

Gli assistenti di programmazione basati su IA già scrivono snippet di codice, effettuano il debug e generano interi programmi. Di solito, i ricercatori testano un singolo modello su un prompt e valutano la sua risposta. Questo test pone una domanda diversa: un gruppo di agent che condividono le scoperte durante il lavoro può superare un approccio basato sulla "saggezza della folla" che si limita a conteggiare risposte indipendenti?

I problemi di Project Euler fungono da benchmark standard per il pensiero algoritmico. Combinano intuizione matematica e programmazione efficiente, rendendoli un ottimo sostituto per i compiti di programmazione del mondo reale, dove correttezza e velocità sono fondamentali.

Come è stato impostato il test

  • Agent: Cinque istanze di Gemini 3.5 Flash accessibili tramite la piattaforma Antigravity.
  • Scenari:
    1. Ogni agent ha affrontato ogni problema da solo, riportando la propria risposta.
    2. Gli stessi cinque agent hanno collaborato in tempo reale, trasmettendo i risultati intermedi e confermando i passaggi reciproci.
    3. Per entrambi i setup, un semplice aggregatore basato sulla maggioranza ha combinato le cinque risposte indipendenti.
  • Metriche: Accuratezza (percentuale di risposte corrette) e tempo di esecuzione (tempo medio per problema, oltre alla distribuzione dei tempi di completamento).

Cosa rivelano i numeri

  • Accuratezza singola: 72 %
  • Accuratezza collaborativa: 87 %
  • Accuratezza singola tramite maggioranza: 80 %
  • Accuratezza collaborativa tramite maggioranza: 90 %

Il tempo di esecuzione è sceso da una media di 14 minuti per gli agent singoli a 10 minuti per il gruppo collaborativo. La maggior parte delle esecuzioni collaborative si è conclusa in meno di cinque minuti, mentre i tentativi singoli hanno spesso raggiunto il limite di timeout di 30 minuti.

Osservazioni chiave che spiegano il divario

  • Impossibile per uno, possibile per molti – Su un singolo problema tutti gli agent singoli sono falliti, eppure il team collaborativo ha scambiato risultati parziali e, collettivamente, è arrivato alla risposta corretta.
  • Rilevamento degli errori tramite verifica incrociata – I singoli agent a volte sono caduti in trappole logiche; il gruppo ha colto questi errori confrontando le informazioni in tempo reale.
  • Rapida convergenza – Quando un agent scopriva un valore intermedio cruciale, lo trasmetteva, permettendo agli altri di saltare il lavoro ridondante e di convergere più velocemente sulla soluzione finale.

I costi e i limiti nascosti

L'esperimento ha utilizzato solo cinque agent; non è ancora chiaro se la stessa efficienza sia scalabile a decine o centinaia di agent. Inoltre, l'aggregatore basato sulla maggioranza ha comunque ottenuto ottimi risultati (90% con la collaborazione).

Cosa osservare in futuro

  • Esperimenti di scalabilità – Cento agent miglioreranno ancora l'accuratezza o prevarrà il sovraccarico di coordinamento?
  • Specializzazione dei ruoli – Assegnare compiti specifici (ad esempio, un agent si concentra sulla teoria dei numeri, un altro sull'ottimizzazione) potrebbe amplificare i benefici rispetto alla collaborazione a schema libero.
  • Benchmark più ampi – Applicare lo stesso framework a sfide di generazione di codice, suite di debugging o build di software reali servirà a testare se i vantaggi si mantengono anche al di fuori dei puzzle matematici.

In sintesi

La collaborazione in tempo reale tra agent di programmazione IA può aumentare sia i tassi di successo che la velocità nei compiti algoritmici, superando i tentativi singoli e persino un semplice voto della folla. L'approccio è promettente, ma la sua scalabilità e il suo rapporto costo-efficacia rimangono questioni aperte che la ricerca futura dovrà affrontare.

Fonte: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0