AI राउटिंग का पेंडोरा बॉक्स (The Pandora Box of AI Routing)

DeepMind ने “Pandora’s Router” का अनावरण किया है, जो एक ऐसा फ्रेमवर्क है जो मॉडल-चयन (model-selection) को एक लागत-सचेत (cost-aware) पेंडोरा-बॉक्स समस्या के रूप में देखता है। केवल उस जानकारी के लिए शुल्क लेकर जो वास्तव में परिणामों में सुधार करती है, यह सिस्टम इन्फरेंस खर्च (inference spend) को काफी कम कर देता है, जबकि परिणाम विस्तृत खोजों (exhaustive searches) के बराबर ही रहते हैं।

मॉडल-चयन मुफ्त क्यों नहीं है

प्रोडक्शन पाइपलाइन्स अक्सर यह मान लेती हैं कि मॉडल चुनने वाले चरण की कोई लागत नहीं होती। वास्तव में, किसी मॉडल की उपयुक्तता का अनुमान लगाने में कंप्यूट (compute), मेमोरी और कभी-कभी बाहरी डेटा कॉल का खर्च होता है। एक त्वरित और शोर वाला (noisy) अनुमान सस्ता होता है लेकिन यह गुमराह कर सकता है; एक सटीक अनुमान का अर्थ आमतौर पर एक छोटे मॉडल को चलाना या अतिरिक्त संदर्भ (context) प्राप्त करना होता है, जिससे लागत बढ़ जाती है।

DeepMind का पेपर इस दुविधा को नए तरीके से पेश करता है। प्रत्येक संभावित मॉडल एक "वैल्यू" (value) छिपाए रखता है – यानी आने वाली क्वेरी पर उसका अपेक्षित प्रदर्शन। यह फ्रेमवर्क एक कंट्रोलर को उस वैल्यू पर नज़र डालने के लिए शुल्क देने की अनुमति देता है और जैसे ही आगे की जानकारी उसकी लागत को उचित नहीं ठहराती, भुगतान करना बंद कर देता है।

समाधान के दो हिस्से

  • Pandora’s Router – एक केंद्रीकृत इंजन जो प्रत्येक अनुरोध के लिए यह निर्णय लेता है कि मॉडल की वैल्यू के अधिक सटीक अनुमान के लिए भुगतान करना है या नहीं। यह एक "रिजर्व प्राइस" (reserve price) निर्धारित करता है: एक ऐसी सीमा जिसके नीचे बेहतर अनुमान से होने वाला अपेक्षित लाभ शुल्क से अधिक नहीं होता है। जब अनुमानित सुधार रिजर्व प्राइस से अधिक हो जाता है, तो इंजन उस जानकारी को खरीद लेता है; अन्यथा यह अपने पास मौजूद सबसे अच्छे अनुमान के साथ आगे बढ़ता है।

  • Pandora’s Bidder – मॉडल मार्केटप्लेस के लिए एक विकेंद्रीकृत समकक्ष। स्वतंत्र प्रदाता यह तय करते हैं कि बोली लगाने से पहले अपने स्वयं के वैल्यू अनुमान को सटीक बनाने के लिए कंप्यूट खर्च करना है या नहीं। उनका अपना रिजर्व प्राइस केवल तभी खर्च करने के लिए मजबूर करता है जब परिष्कृत (refined) अनुमान के जीतने की संभावना हो।

दोनों हिस्से एक ही सिद्धांत साझा करते हैं: जानकारी पर केवल तभी खर्च करें जब अपेक्षित लाभ उसकी लागत से अधिक हो।

तीन डोमेन में परिणाम

लेखकों ने तीन वर्कलोड पर इस दृष्टिकोण का परीक्षण किया:

  1. गणितीय तर्क (Mathematical reasoning) – विभिन्न सटीकता वाले सॉल्वर के बीच चयन करना।
  2. रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) – विभिन्न नॉलेज-बेस लुकअप रणनीतियों के बीच चयन करना।
  3. बड़े पैमाने के एम्बेडिंग मॉडल (Large-scale embedding models) – समानता खोज (similarity search) के लिए सबसे अच्छे एनकोडर का चयन करना।

Pandora’s Router ने हर मामले में स्टैटिक राउटिंग नियमों और ग्रीडी ह्यूरिस्टिक्स (greedy heuristics) को पछाड़ दिया। सबसे कठिन परिदृश्यों में, इसने अधिकांश निरीक्षण लागतों (inspection costs) से बचते हुए सभी मॉडलों के ब्रूट-फोर्स स्कैन की गुणवत्ता के बराबर प्रदर्शन किया। लेखक "अधिकांश निरीक्षण लागतों" के बचने की रिपोर्ट करते हैं, जिसका अर्थ है कि कंप्यूट खर्च में भारी कटौती हुई है।

AI इंजीनियरिंग के लिए इसका क्या अर्थ है

  • राउटिंग ओवरहेड (routing overhead) को नज़रअंदाज़ न करें। किस मॉडल का उपयोग करना है, यह तय करने की एक मापने योग्य लागत होती है।
  • एक रिजर्व प्राइस (reserve price) पेश करें। एक स्पष्ट कटऑफ निर्धारित करें कि कब अतिरिक्त जानकारी अपने शुल्क के लायक है।
  • लागत-सचेत राउटिंग (cost-aware routing) अपनाएं। एक निर्णय परत (decision layer) जो अपेक्षित लाभ और खर्च के बीच संतुलन बनाती है, मॉडल कैटलॉग बढ़ने के साथ बजट को नियंत्रण में रखती है।

काउंटर-पॉइंट: बढ़ी हुई जटिलता

बिडिंग या राउटिंग लेयर जोड़ने से कुछ समझौते (trade-offs) करने पड़ते हैं। टीमों को उस लॉजिक को बनाए रखना होगा जो रिजर्व प्राइस की गणना करता है, शुल्क संरचनाओं की निगरानी करता है, और यह सुनिश्चित करता है कि अतिरिक्त कोड पाथ बॉटलनेक (bottleneck) न बन जाए। केवल कुछ मॉडलों वाले छोटे डिप्लॉयमेंट के लिए, Pandora’s Router बचत से अधिक खर्च करा सकता है। यह फ्रेमवर्क यह भी मानता है कि बेहतर अनुमान की लागत ज्ञात और स्थिर है—एक ऐसा अनुमान जो अस्थिर क्लाउड प्राइसिंग या स्पॉट-इंस्टेंस रुकावटों के कारण विफल हो सकता है।

निष्कर्ष (Takeaway)

मॉडल-चयन को एक आर्थिक निर्णय के रूप में मानें, न कि एक मुफ्त राउटिंग चरण के रूप में। Pandora’s Router दिखाता है कि एक अनुशासित, लागत-सचेत दृष्टिकोण आउटपुट की गुणवत्ता से समझौता किए बिना अनावश्यक कंप्यूट को कम कर सकता है, जिससे AI सिस्टम स्केलेबल और वित्तीय रूप से टिकाऊ बने रहते हैं।