বেঞ্চমার্ক হাইলাইটস

Hot Chips কনফারেন্সে এমন কিছু পরিসংখ্যান প্রকাশ করা হয়েছে যা একটি স্বাধীন সংস্থা InferenceX সুইটের মাধ্যমে যাচাই করেছে। OpenAI Jalapeño-কে একটি সাধারণ-উদ্দেশ্যমূলক (general-purpose) ইনফারেন্স এক্সিলারেটর হিসেবে অভিহিত করেছে—এটি মডেল চালায় কিন্তু সেগুলোকে প্রশিক্ষণ দেয় না। পরীক্ষায় চিপটি:

  • বর্তমানের শীর্ষস্থানীয় চিপগুলোর তুলনায় পিক থ্রুপুট (peak throughput)-এ প্রতি ওয়াটে ১.৫ গুণ থেকে ১.৯ গুণ বেশি কাজ সম্পন্ন করেছে।
  • ল্যাটেন্সি (latency) ১.৭ গুণ থেকে ৩.৬ গুণ কমিয়ে এনেছে, এবং ইন্টারঅ্যাক্টিভ ক্ষেত্রে ২.১ গুণ থেকে ৪.১ গুণ উন্নতি দেখিয়েছে।

মডেল-ভিত্তিক ফলাফল:

  • GPT-OSS 120B: ~১,৪০০ টোকেন/সেকেন্ড/ইউজার।
  • Deepseek R1 670B: একটি একক কনকারেন্ট রিকোয়েস্টে (concurrent request) ~৭০০ টোকেন/সেকেন্ড।
  • Kimi K2.5 1T: হাই-পারফরম্যান্স সুইটে পরীক্ষা করা হয়েছে (সঠিক সংখ্যা প্রকাশ করা হয়নি)।

OpenAI জোর দিয়ে বলেছে যে, এই পরিসংখ্যানগুলো স্পেকুলেটিভ ডিকোডিং (speculative decoding) বা মাল্টি-টোকেন প্রেডিকশন (multi-token prediction) ছাড়াই পাওয়া গেছে—যা অনেক প্রতিদ্বন্দ্বী তাদের মূল সংখ্যাগুলো বাড়িয়ে দেখানোর জন্য ব্যবহার করে থাকে।

কীভাবে Jalapeño তৈরি করা হয়েছে

OpenAI Broadcom-এর সাথে মিলে মাত্র নয় মাসে চিপটির ডিজাইন সম্পন্ন করেছে। সংস্থাটি তাদের নিজস্ব মডেলগুলোকে ডিজাইন লুপে অন্তর্ভুক্ত করেছে, যা ব্লুপ্রিন্টিং, প্রোগ্রামিং এবং অপ্টিমাইজেশনের গতি বাড়িয়ে দিয়েছে—এই পদ্ধতিটিকে "AI-assisted silicon design" বলা হয়। এই দ্রুত অগ্রগতি হাই-পারফরম্যান্স সিলিকন তৈরির ক্ষেত্রে দীর্ঘমেয়াদী চক্র থেকে একটি পরিবর্তনের ইঙ্গিত দেয়।

Nvidia-র আধিপত্যের ওপর প্রভাব

Nvidia তাদের কাঁচা পারফরম্যান্স (raw performance) এবং CUDA ইকোসিস্টেমের ওপর নির্ভর করে। নতুন এই তথ্য পারফরম্যান্সের ক্ষেত্রে তাদের শ্রেষ্ঠত্বকে চ্যালেঞ্জের মুখে ফেলেছে। বিশ্লেষকরা সতর্ক করেছেন যে, যদি আরও অনেক AI সংস্থা একই ধরনের দক্ষতার সাথে কাস্টম ইনফারেন্স সিলিকন বাজারে আনে, তবে ডেভেলপাররা CUDA থেকে সরে যেতে পারেন, যা বিকল্প স্ট্যাক এবং একটি খণ্ডিত বাজারের সুযোগ তৈরি করবে।

OpenAI-র মিশ্র কৌশল (Mixed-Signal Strategy)

চিফ ফিন্যান্সিয়াল অফিসার Kelly Huang Jalapeño-কে একটি বৃহত্তর কম্পিউটিং পরিকল্পনার অংশ হিসেবে বর্ণনা করেছেন, বিদ্যমান অংশীদারদের সম্পূর্ণ বিকল্প হিসেবে নয়। OpenAI এখনও বিভিন্ন কাজের জন্য Nvidia, AMD, AWS এবং Cerebras-এর সাথে কাজ করে। Jalapeño এখনও একটি ইঞ্জিনিয়ারিং স্যাম্পল; এটি Deepseek V4 Pro-এর মতো বড় আসন্ন মডেলগুলোর মুখোমুখি হওয়া এখনও বাকি। Huang-এর মন্তব্য থেকে বোঝা যায় যে, OpenAI প্রতিটি কাজের জন্য সেরা কস্ট-পারফরম্যান্স (cost-performance) নিশ্চিত করতে তাদের নিজস্ব সিলিকনের সাথে থার্ড-পার্টি এক্সিলারেটর ব্যবহার করবে।

পাল্টা যুক্তি (Counterpoints)

প্রাথমিক পর্যায়ের স্যাম্পলগুলো বড় পরিসরে উৎপাদন, ইল্ড (yield) বা দীর্ঘমেয়াদী নির্ভরযোগ্যতার নিশ্চয়তা দেয় না, তাই অতিরিক্ত উত্তেজনা পরিমিত রাখা উচিত।

পরবর্তীতে যা লক্ষ্য রাখতে হবে

  • উৎপাদন শুরু (Production rollout): OpenAI কি Jalapeño-কে গণ-উৎপাদিত পণ্যে রূপান্তর করতে পারবে, এবং তার দাম কত হবে?
  • সফটওয়্যার স্ট্যাক (Software stack): ডেভেলপারদের জন্য প্রোগ্রামিং মডেল এবং টুলচেইন কতটা উন্নত হবে?
  • প্রতিদ্বন্দ্বীদের প্রতিক্রিয়া: মার্কেট শেয়ার রক্ষা করতে Nvidia এবং অন্যান্য ভেন্ডররা তাদের রোডম্যাপ বা দামের ক্ষেত্রে কী ধরনের পরিবর্তন আনবে?
  • মডেল স্কেলিং: পরবর্তী প্রজন্মের ট্রিলিয়ন-প্যারামিটার মডেলগুলোর ক্ষেত্রে Jalapeño কি তার শ্রেষ্ঠত্ব বজায় রাখতে পারবে?

সারকথা: কাস্টম ইনফারেন্স সিলিকন এখন আর কেবল একটি বিশেষ পরীক্ষা নয়, বরং এটি Nvidia-র হার্ডওয়্যার আধিপত্যের জন্য একটি বিশ্বাসযোগ্য চ্যালেঞ্জ হয়ে দাঁড়িয়েছে।