Puszka Pandory routingu AI

DeepMind zaprezentowało „Pandora’s Router” – framework, który traktuje wybór modelu jako problem „Puszki Pandory” uwzględniający koszty. Dzięki pobieraniu opłat tylko za informacje, które faktycznie poprawiają wyniki, system drastycznie redukuje wydatki na inferencję, zachowując przy tym jakość wyników porównywalną z przeszukiwaniem wyczerpującym.

Dlaczego wybór modelu nie jest darmowy

Potoki produkcyjne często zakładają, że krok wyboru modelu nic nie kosztuje. W rzeczywistości szacowanie przydatności modelu zużywa moc obliczeniową, pamięć, a czasem wymaga zewnętrznych wywołań danych. Szybka, mało precyzyjna estymacja jest tania, ale może wprowadzać w błąd; precyzyjna estymacja zazwyczaj oznacza uruchomienie mniejszego modelu lub pobranie dodatkowego kontekstu, co generuje koszty.

Artykuł DeepMind zmienia sposób postrzegania tego dylematu. Każdy model kandydujący skrywa pewną „wartość” – jego oczekiwaną wydajność w odpowiedzi na zapytanie. Framework pozwala kontrolerowi zapłacić za wgląd w tę wartość i przestać płacić, gdy dalsze informacje przestają uzasadniać poniesiony koszt.

Dwa elementy rozwiązania

  • Pandora’s Router – scentralizowany silnik, który dla każdego zapytania decyduje, czy zapłacić za dokładniejszą estymację wartości modelu. Ustala on „cenę rezerwową” (reserve price): próg, poniżej którego oczekiwana korzyść z lepszej estymacji nie przewyższa opłaty. Gdy prognozowana poprawa przekracza cenę rezerwową, silnik kupuje informację; w przeciwnym razie korzysta z najlepszego dostępnego obecnie przypuszczenia.

  • Pandora’s Bidder – zdecentralizowany odpowiednik dla rynków modeli. Niezależni dostawcy decydują, czy poświęcić moc obliczeniową na doprecyzowanie własnej estymacji wartości przed złożeniem oferty. Ich własna cena rezerwowa wymusza wydatki tylko wtedy, gdy doprecyzowana estymacja ma szansę na wygraną.

Obie części opierają się na tej samej zasadzie: wydawaj na informacje tylko wtedy, gdy oczekiwany zwrot przewyższa ich koszt.

Wyniki w trzech obszarach

Autorzy przetestowali to podejście na trzech rodzajach obciążeń:

  1. Rozumowanie matematyczne – wybór spośród solverów o różnym stopniu precyzji.
  2. Retrieval-augmented generation (RAG) – wybór między różnymi strategiami przeszukiwania bazy wiedzy.
  3. Duże modele embeddingowe – wybór najlepszego enkodera do wyszukiwania podobieństwa.

Pandora’s Router pokonał statyczne reguły routingu i heurystyki zachłanne w każdym przypadku. W najtrudniejszych scenariuszach dorównał jakością brute-force'owemu skanowaniu wszystkich modeli, unikając przy tym większości kosztów inspekcji. Autorzy raportują zaoszczędzenie „większości kosztów inspekcji”, co sugeruje drastyczną redukcję wydatków na moc obliczeniową.

Co to oznacza dla inżynierii AI

  • Nie ignoruj narzutu związanego z routingiem. Decyzja o tym, którego modelu użyć, wiąże się z mierzalnym kosztem.
  • Wprowadź cenę rezerwową. Ustal jasny punkt odcięcia, określający, kiedy dodatkowe informacje są warte swojej ceny.
  • Zastosuj routing uwzględniający koszty. Warstwa decyzyjna, która równoważy oczekiwany zysk z wydatkami, pozwala kontrolować budżet wraz ze wzrostem katalogów modeli.

Kontrargument: dodatkowa złożoność

Dodanie warstwy licytacji lub routingu wiąże się z kompromisami. Zespoły muszą utrzymywać logikę obliczającą ceny rezerwowe, monitorować struktury opłat i dbać o to, by dodatkowa ścieżka kodu nie stała się wąskim gardłem. W przypadku małych wdrożeń z zaledwie kilkoma modelami, Pandora’s Router może kosztować więcej, niż zaoszczędzi. Framework zakłada również, że koszt lepszej estymacji jest znany i stabilny – założenie to może zostać podważone przez zmienne ceny w chmurze lub przerwy w działaniu instancji typu spot.

Podsumowanie

Traktuj wybór modelu jako decyzję ekonomiczną, a nie darmowy krok routingu. Pandora’s Router pokazuje, że zdyscyplinowane podejście uwzględniające koszty pozwala wyeliminować zbędne obliczenia bez poświęcania jakości wyników, zapewniając systemom AI skalowalność i stabilność finansową.