Tencent এই সপ্তাহে WeMM-Embedding মডেলটি উন্মোচন করেছে, যা একটি ২ বিলিয়ন-প্যারামিটার বিশিষ্ট মাল্টিমোডাল সিস্টেম এবং এটি ইতিমধ্যে WeChat-এর সার্চ, রিকমেন্ডেশন এবং ই-কমার্স পাইপলাইনে যুক্ত করা হয়েছে। এই রিলিজটি গুরুত্বপূর্ণ কারণ এটি এমন একটি মডেল প্রদর্শন করে যা বাস্তব জগতের রিট্রিভাল কোয়ালিটি (retrieval quality), লো ল্যাটেন্সি (low latency) এবং ছোট ইনডেক্স সাইজ প্রদান করে।

কেন একটি “ডেপ্লয়মেন্ট স্টোরি” নিয়ে এত শোরগোল

বেশিরভাগ নতুন AI মডেল আসে চকচকে বেঞ্চমার্ক টেবিল নিয়ে, যেখানে কিউরেটেড ডেটাসেটের ওপর স্কোর তুলনা করা হয়। সেই সংখ্যাগুলো গবেষকদের কোনো বিষয় প্রমাণ করতে সাহায্য করে ঠিকই, কিন্তু সেগুলো খুব কমই সেই মেট্রিকগুলোতে রূপান্তরিত হয় যা প্রোডাক্টকে সচল রাখে: যেমন একটি কুয়েরি কত দ্রুত ফলাফল দেয়, একটি ইনডেক্স কতটা মেমরি খরচ করে, এবং মডেলটি ব্যবহারকারীর তৈরি করা নয়েজি (noisy) কন্টেন্টের সাথে কতটা ভালোভাবে সামঞ্জস্য বজায় রাখতে পারে। WeMM প্রথম দিন থেকেই একটি প্রোডাকশন-গ্রেড কম্পোনেন্ট হিসেবে কাজ করে এই চিত্রটি বদলে দিয়েছে। এটি কোনো ল্যাব এক্সপেরিমেন্ট নয় যা কোনো ডাউনস্ট্রিম টিমের ব্যবহারের অপেক্ষায় আছে; এটি ইতিমধ্যে Channels, Moments এবং ই-কমার্স পরিচালনা করছে।

ডেভেলপারদের যে প্রযুক্তিগত দিকগুলো লক্ষ্য করা উচিত

  • প্রকৃত মাল্টিমোডাল হ্যান্ডলিং – মডেলটি টেক্সট, ইমেজ, ভিডিও ফ্রেম এবং ডকুমেন্ট থাম্বনেইলগুলোকে একটি একক এমবেডিং স্পেসে গ্রহণ করে। একজন ব্যবহারকারী “sunset” টাইপ করলে আলাদা টেক্সট-অনলি এবং ভিশন-অনলি পাইপলাইন জোড়া না দিয়েই একটি সামঞ্জস্যপূর্ণ ভিডিও ক্লিপ, ছবি বা নিউজ আর্টিকেল খুঁজে পেতে পারেন।

  • সাইজ গুরুত্বপূর্ণ, তবে আপনি যেভাবে ভাবছেন সেভাবে নয় – ৯ বিলিয়নের বেশি প্যারামিটার বিশিষ্ট মডেলগুলোর তুলনায় ২ বিলিয়ন প্যারামিটারের এই মডেলটি “ছোট”। তবুও এটি ইন্টারঅ্যাক্টিভ সার্ভিসের জন্য প্রয়োজনীয় ল্যাটেন্সি বাজেটের মধ্যে থাকে। একটি লাইভ সিস্টেমে আপনার হার্ডওয়্যারের সাথে মানানসই একটি মডেল বড় এবং ধীরগতির মডেলের চেয়েও ভালো পারফর্ম করতে পারে।

  • Matryoshka এমবেডিং ডাইমেনশন বা মাত্রার নমনীয়তা দেয় – WeMM “Matryoshka” এমবেডিং সাপোর্ট করে, যার অর্থ একই নেটওয়ার্ক বিভিন্ন দৈর্ঘ্যের ভেক্টর আউটপুট দিতে পারে, যেমন ২৫৬ বা ৫১২ ডাইমেনশন। পরীক্ষা করে দেখা গেছে যে, ৫১২ থেকে ২৫৬ ডাইমেনশনে নামিয়ে আনলে রিট্রিভাল পারফরম্যান্স প্রায় অপরিবর্তিত থাকে, অথচ মেমরি ব্যবহার অর্ধেক হয়ে যায়, যা সরাসরি স্টোরেজ খরচ কমায় এবং নিয়ারস্ট-নেইবার (nearest-neighbor) সার্চের গতি বাড়িয়ে দেয়।

রিট্রিভাল সিস্টেম তৈরির জন্য তিনটি বাস্তবসম্মত নিয়ম

১. আপনার নিজস্ব ডেটার ওপর যাচাই করুন – বেঞ্চমার্কগুলো পরিচ্ছন্ন থাকে; কিন্তু প্রোডাকশন ডেটা অগোছালো হয়। আপনার ব্যবহারকারীরা যদি স্ক্রিনশট, হাতে লেখা নোট বা লো-রেজোলিউশন ভিডিও আপলোড করেন, তবে মডেলটি আপনার জন্য উপযুক্ত কি না তা সিদ্ধান্ত নেওয়ার আগে ঠিক সেই ধরনের ডেটার মিশ্রণে মডেলটি চালিয়ে দেখুন।

২. ভেক্টর লেন্থকে একটি খরচ কমানোর উপায় হিসেবে বিবেচনা করুন – বড় ভেক্টর সিমিলারিটি সার্চের জন্য প্রয়োজনীয় কম্পিউটেশন এবং ইনডেক্সের জন্য ডিস্ক স্পেস—উভয়ই বাড়িয়ে দেয়। আপনার কোয়ালিটি টার্গেট পূরণ করে এমন ক্ষুদ্রতম ডাইমেনশন দিয়ে শুরু করুন। রিকল (recall) বা প্রিসিশন (precision)-এ স্পষ্ট পতন দেখলে তবেই ডাইমেনশন বাড়ান।

৩. আলাদা বা বিচ্ছিন্ন পাইপলাইন এড়িয়ে চলুন – প্রতিটি মোডালিটির জন্য আলাদা এনকোডার তৈরি করলে আপনাকে ফাইনাল র‍্যাঙ্কিং স্টেজের জন্য হাতে কলমে ওয়েটিং স্কিম (weighting schemes) তৈরি করতে হবে। একটি ইউনিভার্সাল এমবেডিং লেয়ার সেই অতিরিক্ত কোড বা 'glue code' দূর করে, ইঞ্জিনিয়ারিং ওভারহেড কমায় এবং A/B টেস্টিং সহজ করে তোলে।

বৃহত্তর প্রভাব

যে কোম্পানিগুলো সার্চ বা রিকমেন্ডেশনের ওপর নির্ভর করে, তাদের জন্য এমবেডিং মডেলের নির্বাচন ইনফ্রাস্ট্রাকচার খরচ নির্ধারণ করে দিতে পারে। ব্যবহারকারীর প্রত্যাশা বাড়ার সাথে সাথে ল্যাটেন্সি বাজেটও কমে আসে; একটি কুয়েরিতে যদি মাত্র কয়েক মিলিসেকেন্ডও অতিরিক্ত সময় লাগে, তবে সেটি সার্ভিসের গ্রহণযোগ্য পারফরম্যান্সের সীমা ছাড়িয়ে যেতে পারে, যার ফলে ব্যবহারকারী কমে যেতে পারে (churn)।

Apache 2.0 লাইসেন্সের অধীনে মডেলের ওয়েটস (weights) ওপেন-সোর্স করার টেনসেন্টের সিদ্ধান্ত ডেভেলপারদের জন্য খরচের বোঝা কমিয়ে দিয়েছে। প্রোপাইটরি কন্ট্রাক্ট নিয়ে দরকষাকষি করা বা একদম শুরু থেকে একটি মডেল তৈরি করার পরিবর্তে, টিমগুলো সরাসরি চেকপয়েন্ট ডাউনলোড করতে পারে, ডোমেইন-স্পেসিফিক ডেটার ওপর এটি ফাইন-টিউন করতে পারে এবং কিছু নির্দিষ্ট ফেইলর কেসের (failure cases) বিপরীতে এটি মূল্যায়ন করতে পারে।

মডেলটির সীমাবদ্ধতা যেখানে থাকতে পারে

মডেলটি চারটি মোডালিটি—টেক্সট, ইমেজ, ভিডিও এবং ডকুমেন্ট হ্যান্ডেল করে, তবে এটি সম্ভাব্য সব ধরনের ইনপুট কভার করে না।

পরবর্তী পর্যবেক্ষণ

সারসংক্ষেপ

WeMM প্রমাণ করে যে, প্রোডাকশন সীমাবদ্ধতা মাথায় রেখে তৈরি করা হলে একটি মাঝারি আকারের মাল্টিমোডাল এমবেডিং মডেল দৈনন্দিন কুয়েরিগুলো সামলাতে পারে। ডেভেলপারদের জন্য বার্তাটি স্পষ্ট: বাস্তব জগতের রিট্রিভাল কোয়ালিটিকে অগ্রাধিকার দিন, ভেক্টর ডাইমেনশন যতটা সম্ভব ছোট রাখুন, এবং সব মোডালিটিকে একটি একক এমবেডিং লেয়ারে একত্রিত করুন। এই সিদ্ধান্তগুলো ল্যাটেন্সি কমাতে পারে, স্টোরেজ খরচ কমায় এবং শেষ পর্যন্ত এন্ড-ইউজারদের জন্য আরও উন্নত অভিজ্ঞতা প্রদান করতে পারে।