গবেষকরা GraphVid উন্মোচন করেছেন, যা একটি ভিডিও-জেনারেটর সিস্টেম। এটি পূর্ববর্তী মডেলগুলোর তুলনায় এর Fréchet Inception Distance ৩৯.৯% এবং Fréchet Video Distance ৩৭.৬% কমিয়ে আনে। রিয়ালিজম এবং মোশন ফিডেলিটির (গতির নির্ভুলতা) এই উন্নতি রোবোটিক্স সিমুলেটর, স্বয়ংক্রিয় ড্রাইভিং ট্রেনিং স্যুট বা কম্পিউটার-জেনারেটেড অ্যানিমেশন তৈরির কারিগরদের জন্য অত্যন্ত গুরুত্বপূর্ণ।

কেন বর্তমান পদ্ধতিগুলো যথেষ্ট নয়

বর্তমান নিয়ন্ত্রণযোগ্য ভিডিও জেনারেটরগুলো দুটি ইনপুটের ওপর নির্ভর করে। টেক্সট প্রম্পট একটি অস্পষ্ট বর্ণনা দেয় কিন্তু কোনো বস্তুর সঠিক পথ নির্ধারণ করতে পারে না। ট্র্যাজেক্টরি টুলগুলো ব্যবহারকারীদের প্রতিটি চরিত্রের জন্য পিক্সেল-স্তরের পথ এঁকে দিতে বাধ্য করে, যা দৃশ্যগুলোতে একাধিক মিথস্ক্রিয়াশীল সত্তা বা অবস্ট্রাকশন (occlusions) থাকলে ব্যর্থ হয়। ফলে ইঞ্জিনিয়াররা কাঙ্ক্ষিত মোশন তৈরির চেয়ে ভুল ট্র্যাক ঠিক করতেই বেশি সময় ব্যয় করেন।

GraphVid-এর ইন্টারঅ্যাকশন-গ্রাফ পদ্ধতি

GraphVid হাতে আঁকা পথের পরিবর্তে একটি উচ্চ-স্তরের ইন্টারঅ্যাকশন গ্রাফ ব্যবহার করে। প্রতিটি পিক্সেল ম্যাপ করার পরিবর্তে, ব্যবহারকারী সম্পর্কগুলো সংজ্ঞায়িত করেন—যেমন "অবজেক্ট A অবজেক্ট B-এর কাছে যাচ্ছে", "অবজেক্ট C অবজেক্ট D-কে অনুসরণ করছে", "অবজেক্ট E অবজেক্ট F-এর সাথে সংঘর্ষ করছে"। মডেলটি এই গ্রাফটিকে একটি ব্লুপ্রিন্ট হিসেবে পড়ে এবং এই সম্পর্কযুক্ত সংকেতগুলোকে সুসংগত মোশন এবং অবয়বে রূপান্তরিত করে। র-কোঅর্ডিনেটের পরিবর্তে সেমান্টিকসের (semantics) ওপর গুরুত্ব দেওয়ার ফলে, বস্তুগুলো একে অপরের পেছনে অদৃশ্য হয়ে গেলেও এটি সেগুলোর অবস্থান ট্র্যাক করতে পারে।

দলটি একটি ডেডিকেটেড ট্রেনিং সেট তৈরি করেছে যার নাম GraphVid-Bench, যা ভিডিও ক্লিপগুলোকে স্ট্রাকচার্ড রিলেশনাল ডেটার সাথে যুক্ত করে। এই ডেটাসেটটি মডেলটিকে দেখায় কীভাবে বিভিন্ন ইন্টারঅ্যাকশন প্যাটার্নের অধীনে একাধিক বস্তু একসাথে চলাচল করে, যা একে একটি 'মোশন ভোকাবুলারি' প্রদান করে যা ইনফারেন্সের সময় পুনরায় ব্যবহার করা সম্ভব।

পারফরম্যান্সের উন্নতি

মেট্রিক পূর্ববর্তী মডেল GraphVid
Fréchet Inception Distance (FID) ↓ 39.9 %
Fréchet Video Distance (FVD) ↓ 37.6 %
Peak Signal-to-Noise Ratio (PSNR) 9.87 15.98
Structural Similarity Index (SSIM) 0.38 0.61

FID এবং FVD স্কোর কম হওয়ার অর্থ হলো জেনারেট করা ভিডিওগুলো দেখতে আরও বাস্তবসম্মত এবং ফ্রেমগুলোর মধ্যে মোশন বা গতি আরও মসৃণ থাকে। PSNR এবং SSIM-এর বৃদ্ধি আরও শার্প টেক্সচার এবং উন্নত স্ট্রাকচারাল প্রিজারভেশন নির্দেশ করে। সামগ্রিকভাবে, এই সংখ্যাগুলো প্রমাণ করে যে GraphVid উল্লেখযোগ্যভাবে বাস্তব ফুটেজের কাছাকাছি ভিডিও তৈরি করতে পারে।

দক্ষতা এবং ব্যবহারিক প্রভাব

GraphVid পূর্ববর্তী পদ্ধতিগুলোর তুলনায় কম প্যারামিটার এবং কম ট্রেনিং ডেটা ব্যবহার করেই এই সাফল্য অর্জন করেছে। মডেলটি পিক্সেল-স্তরের ডায়নামিক্স মুখস্থ করার পরিবর্তে দৃশ্যের গঠন নিয়ে কাজ করে। AI ইঞ্জিনিয়ারদের জন্য কাজের ধারাটি কষ্টসাধ্য পথ আঁকা থেকে সরে এসে রিলেশনাল ডেটা ডিজাইনের দিকে পরিবর্তিত হচ্ছে—যা বস্তুর সংখ্যা বাড়ার সাথে সাথে স্বয়ংক্রিয়ভাবে স্কেল করতে সক্ষম।

সম্ভাব্য সুবিধাভোগীদের মধ্যে রয়েছে:

  • Robotics – ম্যানুয়াল ট্র্যাজেক্টরি স্ক্রিপ্টিং ছাড়াই সিমুলেটেড এনভায়রনমেন্ট এখন বাস্তবসম্মত অবজেক্ট ইন্টারঅ্যাকশন প্রদর্শন করতে পারে।
  • Autonomous-driving – একাধিক গাড়ি, পথচারী এবং সাইকেল চালকসহ ট্রাফিক সিনারিও উচ্চ-স্তরের ইন্টারঅ্যাকশন রুলস থেকে তৈরি করা সম্ভব, যা ডেটা-অগমেন্টেশন পাইপলাইনকে ত্বরান্বিত করে।
  • Animation – শিল্পীরা গল্পের সম্পর্কের ওপর মনোযোগ দিতে পারেন, আর সিস্টেমটি অন্তর্নিহিত মোশন ফিজিক্স সামলাবে।

সারকথা: অবজেক্টের সম্পর্কগুলোকে প্রাথমিক কন্ট্রোল সিগন্যাল হিসেবে ব্যবহার করার মাধ্যমে, GraphVid ভিডিও জেনারেশনকে নির্মাতাদের জন্য আরও সহজবোধ্য এবং বাস্তব জগতের গতির প্রতি আরও বিশ্বস্ত করে তুলেছে, যা কন্ট্রোলেবল সিন্থেসিসের ক্ষেত্রে একটি নতুন দিক নির্দেশ করছে।