গুগল মঙ্গলবার Gemini 3.5 Transcribe লঞ্চ করেছে। এই speech-to-text মডেলটি অপ্রয়োজনীয় শব্দ (filler words) বাদ দেয়, ব্যবহারকারীর দেওয়া শব্দভাণ্ডার (vocabularies) মেনে চলে এবং একটি একক রেকর্ডিংয়ে সর্বোচ্চ তিনজন বক্তাকে ট্যাগ করতে পারে। কোনো মানুষের সম্পাদনা ছাড়াই কাঁচা অডিওকে পরিমার্জিত ও সুসংগঠিত টেক্সটে রূপান্তর করার মাধ্যমে, এই পরিষেবাটি মিটিং নোট, আইনি নথি এবং আরও অনেক কিছুর জন্য ট্রান্সক্রিপ্ট পরিষ্কার করার কাজে ডেভেলপারদের ব্যয় করা সময় কমিয়ে দেয়।

কেন গুগল এখন এটি বাজারে আনল

গুগলের অডিও-প্রসেসিং স্ট্যাক বছরের পর বছর ধরে বিবর্তিত হচ্ছে, কিন্তু তাদের আগের সংস্করণ Chirp 3 বিরতি (pauses), প্রযুক্তিগত শব্দ এবং বক্তার পরিবর্তন শনাক্ত করতে গিয়ে সমস্যায় পড়ত। রিমোট ওয়ার্ক এবং পডকাস্টিং ট্রান্সক্রিপশন বাজারকে বড় করে তুলেছে, তবুও অনেক প্রতিষ্ঠান এখনও ম্যানুয়াল পোস্ট-প্রসেসিং বা দামী বিশেষায়িত ভেন্ডরদের ওপর নির্ভর করে। Gemini 3.5 Transcribe সেই সমস্যার সমাধান দেয়: এমন একটি মডেল যা কেবল কথা শনাক্তই করে না, বরং তাৎক্ষণিকভাবে তা সম্পাদনাও করে।

নতুন মডেলটি আসলে কী করে

  • স্বয়ংক্রিয়ভাবে filler-word অপসারণ – ট্রান্সক্রিপ্ট তৈরি হওয়ার সময় “um”, “uh” এবং এই জাতীয় অনর্থক শব্দগুলো অদৃশ্য হয়ে যায়, ফলে একটি পরিচ্ছন্ন টেক্সট পাওয়া যায়।
  • কাস্টম শব্দভাণ্ডার (Custom vocabularies) – ব্যবহারকারীরা নির্দিষ্ট বিষয়ের শব্দতালিকা আপলোড করতে পারেন, যা মডেলটিকে সেই শব্দগুলোকে সাধারণ বা ভুল শব্দ হিসেবে "সংশোধন" করা থেকে বিরত রাখে। এটি এমন সব ক্ষেত্রের জন্য গুরুত্বপূর্ণ যেখানে প্রচুর সংক্ষিপ্ত রূপ (acronyms), পণ্যের নাম বা বিদেশি বানান ব্যবহৃত হয়।
  • বক্তার পরিচয় শনাক্তকরণ (Speaker attribution) – সিস্টেমটি সর্বোচ্চ তিনটি ভিন্ন কণ্ঠস্বর শনাক্ত করতে পারে, প্রতিটি কথাকে একজন বক্তার লেবেল দেয় এবং শব্দ-স্তরে টাইমস্ট্যাম্প যোগ করে। আইনি দল, মেডিকেল স্ক্রাইব এবং সাংবাদিকরা সরাসরি সোর্স ফাইল থেকে টাইম-কোডেড রেকর্ড তৈরি করতে পারেন।
  • বহুভাষিক সুবিধা – গুগল দাবি করেছে যে তারা ৮৫টিরও বেশি ভাষায় উন্নত নির্ভুলতা নিশ্চিত করেছে, যা তাদের পূর্ববর্তী মডেলের তুলনায় অনেক বড় একটি অগ্রগতি।

এই সমস্ত সক্ষমতা একটি ডেভেলপার-কেন্দ্রিক API-এর মাধ্যমে পাওয়া যায়। অ্যাপগুলো একটি ট্রান্সক্রিপ্টের জন্য রিকোয়েস্ট পাঠায় এবং একটি JSON পেলোড গ্রহণ করে যাতে ইতিমধ্যে পরিচ্ছন্ন টেক্সট, স্পিকার ট্যাগ এবং টাইমস্ট্যাম্প অন্তর্ভুক্ত থাকে।

Gemini অডিওর বৃহত্তর বিস্তার

Gemini 3.5 Transcribe একটি বৃহত্তর অডিও মডেল পরিবারের অংশ:

  • Gemini 3.5 Live – রিয়েল-টাইম ইন্টারঅ্যাকশনের জন্য অপ্টিমাইজ করা এই মডেলটি আগের লাইভ মডেলগুলোর তুলনায় বাক্যের মাঝখানে বাধা বা ইন্টারাপশন আরও ভালোভাবে সামলাতে পারে।
  • Gemini 3.5 Live Experimental – এটি একটি উচ্চ-স্তরের রিজনিং ভ্যারিয়েন্ট যা জটিল কাজ সমাধান করার সময় তার নিজস্ব ধাপে ধাপে চিন্তাভাবনা বর্ণনা করতে পারে।

উভয় লাইভ মডেলই বর্তমানে macOS Gemini অ্যাপে এবং নির্দিষ্ট কিছু অঞ্চলে অ্যান্ড্রয়েডের Rambler ডিকটেশন ফিচারের মাধ্যমে ইংরেজিতে উপলব্ধ।

কারা উপকৃত হবেন

ডেভেলপাররা কোলাবরেশন টুলস, কন্টেন্ট-ক্রিয়েশন প্ল্যাটফর্ম এবং ভয়েস-চালিত অ্যাসিস্ট্যান্টগুলোতে একটি “কথা বলার সাথে সাথেই পরিচ্ছন্ন করার” (clean-as-you-speak) পাইপলাইন যুক্ত করতে পারেন। প্রতিষ্ঠানগুলো সরাসরি প্রকাশযোগ্য ট্রান্সক্রিপ্ট তৈরি করতে পারবে, ফলে প্রতি মিনিটে চার্জ করা এবং কঠোর ডেটা-হ্যান্ডলিং শর্ত আরোপকারী থার্ড-পার্টি সার্ভিসের ওপর নির্ভরতা কমবে। কন্টেন্ট ক্রিয়েটররা আলাদাভাবে সম্পাদনা না করেই পরিমার্জিত ক্যাপশন প্রকাশ করতে পারবেন, যা ভিডিও এবং পডকাস্ট তৈরির গতি বাড়িয়ে দেবে।

কাদের সমস্যা হতে পারে

স্পিকার ডায়ারাইজেশন (speaker diarization) এবং বিশেষ পরিভাষা (jargon) ব্যবহারের জন্য প্রিমিয়াম রেট নেওয়া বিশেষায়িত ট্রান্সক্রিপশন ভেন্ডরদের চাহিদা কমে যেতে পারে, বিশেষ করে খরচ-সচেতন স্টার্টআপগুলোর মধ্যে। মডেলটির তিন-বক্তার সীমাবদ্ধতা বড় প্রতিষ্ঠানগুলোকে এমন ডেডিকেটেড সলিউশনের দিকে ঠেলে দিতে পারে যা একটি কলে আরও বেশি অংশগ্রহণকারীকে সমর্থন করে।

সীমাবদ্ধতা এবং অমীমাংসিত প্রশ্নসমূহ

  • বক্তার সংখ্যা – প্রতিটি ফাইলে মাত্র তিনজন বক্তাকে আলাদা করা সম্ভব; বড় প্যানেল সম্বলিত মিটিংয়ের জন্য এখনও বাহ্যিক টুলের প্রয়োজন হবে।
  • ভাষার বিস্তার – বহুভাষিক সমর্থনের ঘোষণা দেওয়া হলেও, লাইভ মডেলগুলো এখনও শুধুমাত্র ইংরেজি কেন্দ্রিক, যার ফলে অ-ইংরেজিভাষী ব্যবহারকারীরা পূর্ণ কার্যকারিতার জন্য অপেক্ষা করছেন।
  • প্রাইভেসি – যেকোনো ক্লাউড-ভিত্তিক স্পিচ সার্ভিসের মতো, প্রতিষ্ঠানগুলোকে গুগলের অবকাঠামোগত সুবিধার বিপরীতে সংবেদনশীল অডিও এক্সটার্নাল সার্ভার থেকে দূরে রাখার প্রয়োজনীয়তার বিষয়টি বিবেচনা করতে হবে। গুগলের শর্তাবলী অনুযায়ী নির্দিষ্ট গ্রাহকদের জন্য অন-প্রিমিস (on-premise) ডেপ্লয়মেন্টের সুযোগ রয়েছে, তবে সেই অপশনটি এখনও জনসমক্ষে আসেনি।

পরবর্তী বিষয় যা লক্ষ্য রাখতে হবে

গুগল ভবিষ্যতে এমন আপডেটের ইঙ্গিত দিয়েছে যা বক্তার সংখ্যা বৃদ্ধি করবে এবং লাইভ মডেলের ভাষাগত পরিধি আরও বিস্তৃত করবে। এপিআই (API)-এর প্রাইসিং টিয়ার বা মূল্যস্তরগুলো পর্যবেক্ষণ করাও জরুরি হবে; প্রতি মিনিটের উচ্চ খরচ উচ্চ-ভলিউম ব্যবহারকারীদের উৎপাদনশীলতা কমিয়ে দিতে পারে। পরিশেষে, ডেভেলপারদের মধ্যে এর গ্রহণ করার প্রবণতা দেখে বোঝা যাবে যে স্বয়ংক্রিয়ভাবে filler removal-এর সুবিধা কি বিশেষ পরিভাষার ক্ষেত্রে অবশিষ্ট ত্রুটিগুলোর চেয়ে বেশি কার্যকর।

সারসংক্ষেপ: Gemini 3.5 Transcribe কথা বা অডিও রেকর্ডিং পরিমার্জনের ক্লান্তিকর কাজটিকে একটি মাত্র API কলের মাধ্যমে সহজ করে তোলে, যা ডেভেলপারদের পরিচ্ছন্ন এবং স্পিকার-ট্যাগযুক্ত টেক্সট তৈরির জন্য একটি রেডিমেড টুল প্রদান করে। এর সাফল্য নির্ভর করছে গুগল কত দ্রুত ভাষার সমর্থন বৃদ্ধি করে, স্পিকারের সীমা বাড়ায় এবং এন্টারপ্রাইজ প্রাইভেসি সংক্রান্ত উদ্বেগগুলো সমাধান করে তার ওপর।