पेंडोरा का AI मॉडल रूटिंग बॉक्स (Pandora's AI Model Routing Box)

DeepMind का नया शोध पत्र एक "पेंडोरा बॉक्स" (Pandora’s Box) फ्रेमवर्क का प्रस्ताव देता है जो कार्य प्रदर्शन (task performance) को बदले बिना रूटिंग ओवरहेड को 70% तक कम कर देता है।

रूटिंग लागत क्यों महत्वपूर्ण है

जब किसी सर्विस को कोई अनुरोध (request) प्राप्त होता है, तो उसके पास अक्सर मॉडलों की एक सूची होती है—कुछ तेज़ लेकिन कम सटीक, तो कुछ धीमे लेकिन सटीक। सबसे अच्छे मॉडल का चयन करने में कंप्यूटिंग शक्ति और धन (dollars) दोनों खर्च होते हैं। यह जानने से पहले कि कौन सा मॉडल उपयुक्त है, आपको एक त्वरित परीक्षण करना होगा, बाहरी डेटा प्राप्त करना होगा, या किसी सहायक टूल का उपयोग करना होगा।

पेंडोरा बॉक्स की उपमा (analogy)

DeepMind रूटिंग की समस्या को क्लासिक 'पेंडोरा बॉक्स' पहेली के रूप में देखता है: प्रत्येक मॉडल एक सीलबंद बॉक्स है जो वर्तमान क्वेरी पर अपने प्रदर्शन को छिपाए रखता है। बॉक्स खोलने में संसाधन खर्च होते हैं, इसलिए आपको यह तय करना होगा कि क्या संभावित लाभ उस खर्च को उचित ठहराता है। यह फ्रेमवर्क इस समझौते (trade-off) को औपचारिक रूप देता है और दो ठोस तंत्र (mechanisms) प्रदान करता है।

पेंडोरा राउटर (Pandora’s Router) – एक केंद्रीकृत निर्णय लेने वाला

राउटर सबसे पहले मॉडल की क्षमता का आकलन करने के लिए एक सस्ता और कम सटीक (noisy) एस्टिमेटर चलाता है। केवल तभी जब वर्तमान सर्वश्रेष्ठ मॉडल की तुलना में अपेक्षित सुधार एक पूर्व-निर्धारित "आरक्षण मूल्य" (reservation price) से अधिक होता है, तो यह अधिक सटीक मूल्यांकन के लिए भुगतान करता है। प्रत्येक मॉडल का निरीक्षण करने से इनकार करके, राउटर निरीक्षण बजट को काफी कम कर देता है और फिर भी सर्वश्रेष्ठ प्रदर्शन करने वाले विकल्प को सामने लाता है।

पेंडोरा बिडर (Pandora’s Bidder) – एक विकेंद्रीकृत बाज़ार

बिडर वेरिएंट में, प्रत्येक मॉडल प्रदाता यह तय करता है कि क्या वह स्वयं के मूल्यांकन (self-assessment) पर पैसा खर्च करना चाहता है जिससे उसे अनुबंध (contract) मिल सके। प्रदाता बोली (bid) तभी लगाते हैं जब उन्हें उम्मीद होती है कि जीतने की संभावना मूल्यांकन की लागत से अधिक होगी। यह एक ऐसा बाज़ार बनाता है जहाँ महंगी गणनाएँ (evaluations) तभी होती हैं जब लाभ पर्याप्त हो।

तीन क्षेत्रों में परिणाम

लेखकों ने दोनों तंत्रों का परीक्षण इन क्षेत्रों में किया:

  • गणितीय तर्क (Math reasoning) – उस मॉडल का चयन करना जो समस्या को सबसे सटीक रूप से हल करता है।
  • रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) – उस रिट्रीवल सिस्टम को चुनना जो भाषा मॉडल द्वारा उत्तर देने से पहले सबसे प्रासंगिक संदर्भ (context) प्रदान करता है।
  • बड़े पैमाने पर एम्बेडिंग चयन (Large-scale embedding selection) – उस एनकोडर को चुनना जो समानता खोज (similarity search) के लिए सबसे अच्छा वेक्टर प्रतिनिधित्व प्रदान करता है।

हर मामले में, पेंडोरा राउटर ने सबसे कम संयुक्त 'लागत-प्लस-त्रुटि' (cost-plus-error) मेट्रिक दर्ज किया, जिससे उन बेसलाइन मॉडलों को मात मिली जो या तो हमेशा हर मॉडल का निरीक्षण करते हैं या कभी नहीं करते। सिस्टम स्वचालित रूप से अनुकूलित होता है: जब निरीक्षण लागत बढ़ती है, तो यह कम मॉडलों का निरीक्षण करता है; जब लागत कम होती है, तो यह जांच बढ़ा देता है। रिपोर्ट की गई बचत रूटिंग खर्चों का 30% से 70% तक है, और डाउनस्ट्रीम कार्य की गुणवत्ता में कोई मापने योग्य गिरावट नहीं आई है।

निष्कर्ष (Takeaway): जैसे-जैसे इन्फरेंस बजट (inference budgets) बढ़ रहे हैं, बेहतर मॉडल की तलाश कब रोकनी है, यह तय करना उतना ही महत्वपूर्ण हो जाता है जितना कि स्वयं मॉडल का चयन करना। पेंडोरा बॉक्स एक छिपे हुए खर्च को एक नियंत्रणीय लीवर (controllable lever) में बदल देता है।

स्रोत: https://dev.to/andrea_schiona/pandoras-ai-model-routing-box-efficient-allocation-with-costly-value-estimation-3c4c