PandoraのAIモデル・ルーティング・ボックス
DeepMindの新しい論文は、タスクのパフォーマンスを維持したまま、ルーティングのオーバーヘッドを最大70%削減する「Pandora's Box(パンドラの箱)」フレームワークを提案しています。
なぜルーティングコストが重要なのか
サービスがリクエストを受け取ると、多くの場合、複数のモデルの選択肢(メニュー)が存在します。高速だが精度が粗いものもあれば、低速だが精密なものもあります。最適なモデルを選択するには、計算リソースとコストがかかります。どのモデルが適しているかを判断するために、クイックテストの実行、外部データの取得、あるいはヘルパーツールの呼び出しなどが必要になります。
Pandora's Boxの比喩
DeepMindは、ルーティングの問題を古典的な「パンドラの箱」のパズルになぞらえています。各モデルは、現在のクエリに対するパフォーマンスを隠した「密閉された箱」です。箱を開けるにはリソースを消費するため、得られる潜在的な利益がその費用に見合うかどうかを判断しなければなりません。このフレームワークは、このトレードオフを定式化し、2つの具体的なメカニズムを提供します。
Pandora’s Router – 中央集権的な意思決定者
ルーターはまず、安価でノイズの多い推定器を実行して、モデルの有望性を測定します。現在の最良モデルに対する期待される改善が、あらかじめ設定された「予約価格(reservation price)」を超える場合にのみ、より正確な評価のためのコストを支払います。すべてのモデルを調査することを拒否することで、ルーターは最高のパフォーマンスを発揮する選択肢を見出しつつ、調査予算を大幅に削減します。
Pandora’s Bidder – 分散型のマーケットプレイス
Bidder(入札者)バリアントでは、各モデルプロバイダーが、契約獲得につながる可能性のある自己評価に費用を投じるかどうかを決定します。プロバイダーは、評価コストを上回る契約獲得のチャンスがあると期待できる場合にのみ、入札を行います。これにより、報酬が十分に高い場合にのみ高コストな評価が行われる市場が形成されます。
3つのドメインにおける結果
著者らは、以下の3つの領域で両方のメカニズムをテストしました。
- 数学的推論 – 問題を最も正確に解くモデルの選択。
- 検索拡張生成 (RAG) – 言語モデルが回答を生成する前に、最も関連性の高いコンテキストを提供する検索システムの選択。
- 大規模な埋め込み(embedding)選択 – 類似性検索において最適なベクトル表現をもたらすエンコーダーの選択。
いずれの場合においても、Pandora’s Routerは「コスト+エラー」の複合指標において最低値を記録し、すべてのモデルを常に調査する、あるいは全く調査しないといったベースラインを上回りました。このシステムは自動的に適応します。調査コストが上がれば調査するモデルを減らし、コストが下がれば調査を強化します。報告されたルーティング費用の節約率は30%から70%に及び、ダウンストリームのタスク品質に測定可能な低下は見られませんでした。
まとめ: 推論予算が膨れ上がる中、より良いモデルを探すための探索を「いつ」止めるかを判断することは、モデルそのものを選ぶことと同じくらい重要になっています。Pandora's Boxは、隠れた費用を制御可能なレバーへと変えるのです。
