AI রাউটিংয়ের প্যান্ডোরা বক্স

DeepMind উন্মোচন করেছে “Pandora’s Router,” একটি ফ্রেমওয়ার্ক যা মডেল নির্বাচনকে একটি খরচ-সচেতন (cost-aware) প্যান্ডোরা বক্স সমস্যা হিসেবে বিবেচনা করে। শুধুমাত্র সেই তথ্যের জন্য চার্জ করার মাধ্যমে যা প্রকৃতপক্ষে ফলাফল উন্নত করে, এই সিস্টেমটি ইনফারেন্স খরচ ব্যাপকভাবে কমিয়ে আনে এবং একই সাথে বিস্তারিত অনুসন্ধানের (exhaustive searches) সমতুল্য ফলাফল বজায় রাখে।

কেন মডেল নির্বাচন বিনামূল্যে পাওয়া যায় না

প্রোডাকশন পাইপলাইনগুলো প্রায়শই ধরে নেয় যে মডেল নির্বাচন করার ধাপটির কোনো খরচ নেই। বাস্তবে, একটি মডেলের উপযোগিতা অনুমান করতে কম্পিউট, মেমরি এবং কখনও কখনও এক্সটার্নাল ডেটা কল খরচ হয়। একটি দ্রুত এবং অস্পষ্ট (noisy) অনুমান সস্তা হতে পারে কিন্তু তা বিভ্রান্তিকর হতে পারে; অন্যদিকে একটি নির্ভুল অনুমানের জন্য সাধারণত একটি ছোট মডেল চালানো বা অতিরিক্ত কনটেক্সট সংগ্রহ করার প্রয়োজন হয়, যা খরচ বাড়িয়ে দেয়।

DeepMind-এর গবেষণাপত্রটি এই দ্বিধাকে নতুনভাবে সংজ্ঞায়িত করেছে। প্রতিটি সম্ভাব্য মডেল একটি “ভ্যালু” (value) লুকিয়ে রাখে – যা হলো ইনকামিং কুয়েরির ওপর তার প্রত্যাশিত পারফরম্যান্স। এই ফ্রেমওয়ার্কটি একটি কন্ট্রোলারকে সেই ভ্যালু দেখার জন্য একটি ফি প্রদান করতে দেয় এবং যখন অতিরিক্ত তথ্য পাওয়ার সুবিধা তার খরচের তুলনায় কম হয়, তখন ফি দেওয়া বন্ধ করে দেয়।

সমাধানের দুটি অংশ

  • Pandora’s Router – একটি সেন্ট্রালাইজড ইঞ্জিন যা প্রতিটি রিকোয়েস্টের জন্য সিদ্ধান্ত নেয় যে একটি মডেলের ভ্যালুর আরও নির্ভুল অনুমানের জন্য ফি প্রদান করা হবে কি না। এটি একটি “রিজার্ভ প্রাইস” (reserve price) নির্ধারণ করে: একটি নির্দিষ্ট সীমা যার নিচে একটি উন্নত অনুমানের মাধ্যমে প্রত্যাশিত লাভ ফি-এর চেয়ে বেশি হয় না। যখন প্রজেক্টেড উন্নতি রিজার্ভ প্রাইস অতিক্রম করে, তখন ইঞ্জিনটি সেই তথ্যটি ক্রয় করে; অন্যথায় এটি ইতিমধ্যে থাকা সেরা অনুমানের ভিত্তিতে কাজ চালিয়ে যায়।

  • Pandora’s Bidder – মডেল মার্কেটপ্লেসের জন্য একটি ডিসেন্ট্রালাইজড প্রতিপক্ষ। স্বতন্ত্র প্রোভাইডাররা বিড জমা দেওয়ার আগে তাদের নিজস্ব ভ্যালু অনুমান আরও নিখুঁত করতে কম্পিউট খরচ করবেন কি না তা সিদ্ধান্ত নেয়। তাদের নিজস্ব রিজার্ভ প্রাইস নিশ্চিত করে যে খরচ তখনই করা হবে যখন পরিমার্জিত অনুমানটি জেতার সম্ভাবনা থাকে।

উভয় অংশই একই নীতি অনুসরণ করে: শুধুমাত্র তখনই তথ্যের জন্য খরচ করা হবে যখন প্রত্যাশিত লাভ তার খরচের চেয়ে বেশি হবে।

তিনটি ডোমেইনে ফলাফল

লেখকরা তিনটি ওয়ার্কলোডে এই পদ্ধতিটি পরীক্ষা করেছেন:

  1. Mathematical reasoning – বিভিন্ন প্রিসিশন বা নির্ভুলতার সলভারদের মধ্য থেকে নির্বাচন করা।
  2. Retrieval-augmented generation (RAG) – বিভিন্ন নলেজ-বেস লুকআপ কৌশলের মধ্যে নির্বাচন করা।
  3. Large-scale embedding models – সিমিলারিটি সার্চের জন্য সেরা এনকোডার নির্বাচন করা।

Pandora’s Router প্রতিটি ক্ষেত্রেই স্ট্যাটিক রাউটিং রুলস এবং গ্রিডি হিউরিস্টিকসকে ছাড়িয়ে গেছে। কঠিনতম পরিস্থিতিতে এটি অধিকাংশ ইন্সপেকশন খরচ এড়িয়ে সমস্ত মডেলের ব্রুট-ফোর্স স্ক্যানের সমতুল্য মান বজায় রাখতে সক্ষম হয়েছে। লেখকরা জানিয়েছেন যে “অধিকাংশ ইন্সপেকশন খরচ” সাশ্রয় হয়েছে, যা কম্পিউট খরচে ব্যাপক কমানোর ইঙ্গিত দেয়।

AI ইঞ্জিনিয়ারিংয়ের জন্য এর গুরুত্ব

  • রাউটিং ওভারহেড উপেক্ষা করবেন না। কোন মডেল ব্যবহার করা হবে তা নির্ধারণ করার একটি পরিমাপযোগ্য খরচ রয়েছে।
  • একটি রিজার্ভ প্রাইস চালু করুন। অতিরিক্ত তথ্য কখন ফি-এর তুলনায় মূল্যবান হবে তার জন্য একটি স্পষ্ট সীমা নির্ধারণ করুন।
  • কস্ট-অ্যাওয়ার রাউটিং গ্রহণ করুন। একটি ডিসিশন লেয়ার যা প্রত্যাশিত লাভের সাথে খরচের ভারসাম্য বজায় রাখে, মডেল ক্যাটালগ বৃদ্ধির সাথে সাথে বাজেট নিয়ন্ত্রণে রাখতে সাহায্য করে।

পাল্টা যুক্তি: অতিরিক্ত জটিলতা

একটি বিডিং বা রাউটিং লেয়ার যোগ করার কিছু নেতিবাচক দিকও রয়েছে। টিমগুলোকে রিজার্ভ প্রাইস গণনা করার লজিক বজায় রাখতে হয়, ফি স্ট্রাকচার মনিটর করতে হয় এবং অতিরিক্ত কোড পাথ যেন কোনো বাধা (bottleneck) হয়ে না দাঁড়ায় তা নিশ্চিত করতে হয়। মাত্র কয়েকটি মডেল সম্বলিত ছোট ডিপ্লয়মেন্টের ক্ষেত্রে, Pandora’s Router সাশ্রয়ের চেয়ে বেশি খরচ করতে পারে। এই ফ্রেমওয়ার্কটি আরও ধরে নেয় যে একটি উন্নত অনুমানের খরচ জানা এবং স্থিতিশীল—এমন একটি ধারণা যা অস্থির ক্লাউড প্রাইসিং বা স্পট-ইনস্ট্যান্স ইন্টারাপশনের কারণে ভেঙে যেতে পারে।

মূল কথা

মডেল নির্বাচনকে একটি অর্থনৈতিক সিদ্ধান্ত হিসেবে বিবেচনা করুন, কোনো বিনামূল্যে রাউটিং ধাপ হিসেবে নয়। Pandora’s Router দেখায় যে একটি সুশৃঙ্খল, খরচ-সচেতন পদ্ধতি আউটপুট কোয়ালিটি বিসর্জন না দিয়ে অপ্রয়োজনীয় কম্পিউট কমিয়ে আনতে পারে, যা AI সিস্টেমকে স্কেলেবল এবং আর্থিকভাবে টেকসই রাখে।