Il sistema di routing dei modelli AI "Pandora's Box"
Il nuovo paper di DeepMind propone un framework chiamato “Pandora’s Box” che riduce i costi di routing fino al 70%, mantenendo invariata la performance nei task.
Perché i costi di routing sono importanti
Quando un servizio riceve una richiesta, spesso ha a disposizione un menu di modelli: alcuni veloci ma approssimativi, altri lenti ma precisi. Scegliere il migliore comporta costi di calcolo e monetari. È necessario eseguire un test rapido, recuperare dati esterni o chiamare uno strumento di supporto prima di sapere quale modello sia il più adatto.
L'analogia di Pandora's Box
DeepMind associa il problema del routing al classico enigma di Pandora's Box: ogni modello è una scatola sigillata che nasconde le proprie prestazioni sulla query corrente. Aprire una scatola consuma risorse, quindi bisogna decidere se il potenziale guadagno giustifica la spesa. Il framework formalizza questo compromesso e fornisce due meccanismi concreti.
Pandora’s Router – un decisore centralizzato
Il router esegue innanzitutto un estimatore economico e impreciso per valutare la promessa di un modello. Solo se il miglioramento atteso rispetto al migliore attuale supera un “prezzo di riserva” prestabilito, il router paga per una valutazione più accurata. Rifiutandosi di ispezionare ogni modello, il router abbatte il budget di ispezione pur individuando l'opzione con le migliori prestazioni.
Pandora’s Bidder – un mercato decentralizzato
Nella variante "bidder", ogni fornitore di modelli decide se spendere denaro in un'autovalutazione che potrebbe fargli vincere un contratto. I fornitori presentano offerte solo quando prevedono che il costo della valutazione sia ampiamente compensato dalla possibilità di vincere. Ciò crea un mercato in cui le valutazioni costose avvengono solo quando il ritorno è sufficientemente alto.
Risultati in tre ambiti
Gli autori hanno testato entrambi i meccanismi su:
- Ragionamento matematico – selezionare il modello che risolve un problema con la massima precisione.
- Retrieval-augmented generation (RAG) – scegliere il sistema di recupero che fornisce il contesto più pertinente prima che un modello linguistico generi una risposta.
- Selezione di embedding su larga scala – scegliere l'encoder che produce la migliore rappresentazione vettoriale per la ricerca di similarità.
In ogni caso, Pandora’s Router ha registrato la metrica combinata costo-più-errore più bassa, superando i baseline che ispezionano sempre ogni modello o che non effettuano alcuna ispezione. Il sistema si adatta automaticamente: quando i costi di ispezione aumentano, ispeziona meno modelli; quando diminuiscono, intensifica lo scrutinio. Il risparmio riportato va dal 30% al 70% delle spese di routing, senza cali misurabili nella qualità dei task a valle.
In sintesi: Con l'aumento esponenziale dei budget per l'inferenza, decidere quando smettere di cercare un modello migliore diventa cruciale quanto la scelta del modello stesso. Pandora’s Box trasforma una spesa nascosta in una leva controllabile.
