Il nuovo metodo di ABSeeker, denominato “Answer-Backtracked Credit Assignment” (ABC), consente agli agenti di ricerca a lungo raggio di ricevere un credito per ogni singolo passaggio invece che solo per la risposta finale; un modello da 4 miliardi di parametri addestrato con questo metodo può già eguagliare o superare concorrenti molto più grandi.

Questa innovazione è importante perché la maggior parte degli agenti esistenti viene giudicata solo alla fine di un compito. Se la risposta finale è corretta, l'intera sessione viene considerata positiva; se è errata, l'intera sequenza viene considerata negativa. Questo feedback "tutto o niente" nasconde il vero segnale di apprendimento: mosse corrette seguite casualmente da un errore, o clic inutili che per fortuna portano al risultato giusto. L'approccio di ABSeeker riscrive queste regole.

Perché il vecchio approccio è insufficiente

Quando un agente effettua una ricerca, scrive codice o raccoglie prove, compie tipicamente molte azioni: invia query, apre pagine, esegue comandi, controlla lo stato del sistema e così via. In una sessione di quindici passaggi, un singolo errore può compromettere la risposta finale, anche se i passaggi precedenti erano corretti. Al contrario, una sessione che termina con la risposta giusta potrebbe essersi basata sulla fortuna, con la maggior parte dei passaggi che non aggiunge alcun valore. L'addestramento basato solo sul risultato finale costringe il modello a trattare l'intera traiettoria come un'unica scatola nera, rendendo difficile imparare quali sotto-comportamenti siano effettivamente utili.

La situazione rispecchia il debugging nell'ingegneria del software. Gli sviluppatori tracciano ogni riga, isolano la chiamata che fallisce e la correggono. Gli agenti, tuttavia, non hanno ricevuto una "ricevuta" comparabile del loro lavoro interno. Senza tale traccia di audit, gli sviluppatori non possono capire se un miglioramento sia dovuto a un ragionamento migliore o al puro caso, e non possono correggere sistematicamente le cattive abitudini.

Come l'ABC riconfigura l'assegnazione del credito

L'Answer-Backtracked Credit Assignment lavora a ritroso partendo dalla risposta finale corretta. Estrae innanzitutto gli indizi essenziali da cui dipende la risposta: prove specifiche, risultati intermedi o controlli di stato. Successivamente, risale la traccia registrata, assegnando un punteggio a ogni azione in base a quegli indizi. Un'azione che ha contribuito direttamente a un indizio necessario ottiene un credito positivo; un'azione irrilevante o dannosa riceve un punteggio negativo o pari a zero.

Due regimi di addestramento si basano su questo punteggio:

  • ABC-SFT (Supervised Fine-Tuning) ricalibra la funzione di perdita (loss function) in modo che i passaggi con un credito maggiore influenzino il modello più fortemente. Il modello impara a dare priorità alle azioni che storicamente hanno portato a indizi utili.
  • ABC-GRPO (Gradient-based Reward Policy Optimization) tratta i punteggi per ogni passaggio come un segnale di ricompensa per l'apprendimento per rinforzo, rafforzando le parti specifiche di una ricerca che hanno aiutato l'emersione della risposta.

Trasformando un'etichetta binaria di successo/insuccesso in una mappa granulare dei contributi, l'ABC fornisce al modello un segnale di apprendimento molto più ricco.

I primi risultati parlano chiaro

I ricercatori hanno applicato l'ABC a un modesto modello da 4 miliardi di parametri dotato di uno strato di gestione del contesto che tiene traccia dell'evoluzione dello stato della ricerca. In task di benchmark che tradizionalmente favoriscono agenti molto più grandi, il modello addestrato con ABC ha eguagliato o superato tali sistemi più grandi. Questo guadagno di prestazioni è avvenuto senza aumentare la dimensione del modello, suggerendo che una migliore assegnazione del credito può sostituire il semplice numero di parametri.

La lezione principale è semplice: fornisci al modello una ricevuta chiara di ciò che ha funzionato e potrà estrarre più valore dalla stessa quantità di dati di addestramento.

Cosa significa per gli agenti nel mondo reale

Qualsiasi agente che svolge un lavoro multi-fase — assistenti alla programmazione, bot per la revisione della letteratura

L'Answer-Backtracked Credit Assignment ribalta il modo in cui insegniamo agli agenti a cercare, programmare e ragionare. Premiaando le mosse corrette lungo il percorso invece di concentrarsi solo sulla destinazione finale, permette a un modello di dimensioni modeste di apprendere con la stessa efficacia di modelli molto più grandi. Per chiunque stia sviluppando agenti che devono eseguire compiti multi-step, adottare un regime di addestramento incentrato sulle tracce non è un'opzione: è la strada verso un'IA affidabile, verificabile e, in ultima analisi, più intelligente.