गुगलने मंगळवारी Gemini 3.5 Transcribe लाँच केले. हे स्पीच-टू-टेक्स्ट मॉडेल फिलर वर्ड्स (filler words) काढून टाकते, वापरकर्त्याने दिलेल्या शब्दसंग्रहाचा (vocabularies) आदर करते आणि एकाच रेकॉर्डिंगमध्ये तीन वक्तांपर्यंत टॅग करू शकते. मानवी संपादकाशिवाय कच्च्या ऑडिओचे पॉलिश आणि संरचित मजकुरात रूपांतर करून, ही सेवा मीटिंग नोट्स, कायदेशीर कागदपत्रे आणि इतर गोष्टींसाठी ट्रान्सक्रिप्ट्स स्वच्छ (clean up) करण्यासाठी डेव्हलपर्सचा लागणारा वेळ वाचवते.

गुगलने आताच हे पाऊल का उचलले

गुगलचे ऑडिओ-प्रोसेसिंग स्टॅक अनेक वर्षांपासून विकसित होत आहे, परंतु त्याचे पूर्वीचे उत्पादन, Chirp 3, अजूनही विराम (pauses), तांत्रिक शब्द आणि वक्त्यांच्या बदलांमध्ये अडखळत असे. रिमोट वर्क आणि पॉडकास्टिंगमुळे ट्रान्सक्रिप्शन मार्केटमध्ये मोठी वाढ झाली आहे, तरीही अनेक उद्योग (enterprises) अजूनही मॅन्युअल पोस्ट-प्रोसेसिंग किंवा महागड्या विशेष विक्रेत्यांवर अवलंबून आहेत. Gemini 3.5 Transcribe या अडचणीवर उपाय देते: एक असे मॉडेल जे केवळ बोलणे ओळखत नाही तर ते त्वरित (on the fly) संपादित देखील करते.

हे नवीन मॉडेल प्रत्यक्षात काय करते

  • स्वयंचलित फिलर-वर्ड रिमूव्हल (Automatic filler-word removal) – ट्रान्सक्रिप्ट तयार होताना “um”, “uh” आणि तत्सम अडखळणे (disfluencies) गायब होतात, ज्यामुळे अधिक स्पष्ट मजकूर मिळतो.
  • कस्टम शब्दसंग्रह (Custom vocabularies) – वापरकर्ते विशिष्ट क्षेत्रातील शब्दांची यादी अपलोड करू शकतात, ज्यामुळे मॉडेल त्यांना सामान्य शब्दांमध्ये "दुरुस्त" करण्यापासून रोखते. संक्षिप्त रूपे (acronyms), उत्पादनांची नावे किंवा परदेशी स्पेलिंग असलेल्या क्षेत्रांसाठी हे अत्यंत महत्त्वाचे आहे.
  • वक्ता ओळख (Speaker attribution) – ही प्रणाली तीन वेगवेगळ्या आवाजांपर्यंत ओळखते, प्रत्येक वाक्याला वक्त्याचे लेबल देते आणि शब्दांच्या स्तरावर टाइमस्टॅम्प जोडते. कायदेशीर टीम, वैद्यकीय लिपिक (medical scribes) आणि पत्रकार थेट मूळ फाईलमधून टाइम-कोडेड रेकॉर्ड तयार करू शकतात.
  • बहुभाषिक व्याप्ती (Multilingual reach) – गुगलचा दावा आहे की ८५ पेक्षा जास्त भाषांमध्ये अचूकता सुधारली आहे, जे त्याच्या आधीच्या मॉडेलपेक्षा एक पाऊल पुढे आहे.

ही सर्व क्षमता डेव्हलपर-केंद्रित API द्वारे उपलब्ध आहेत. ॲप्स ट्रान्सक्रिप्टची विनंती करतात आणि त्यांना JSON पेलोड मिळतो ज्यामध्ये आधीच स्वच्छ केलेला मजकूर, स्पीकर टॅग आणि टाइमस्टॅम्प समाविष्ट असतात.

Gemini ऑडिओचा व्यापक विस्तार

Gemini 3.5 Transcribe हे ऑडिओ मॉडेल्सच्या एका मोठ्या कुटुंबाचा भाग आहे:

  • Gemini 3.5 Live – रिअल-टाइम संवादासाठी ऑप्टिमाइझ केलेले हे मॉडेल, पूर्वीच्या लाइव्ह मॉडेल्सपेक्षा वाक्याच्या मध्यंतरी होणारे अडथळे अधिक चांगल्या प्रकारे हाताळते.
  • Gemini 3.5 Live Experimental – हे उच्च-स्तरीय तर्कशक्ती असलेले मॉडेल आहे जे जटिल कार्ये सोडवताना स्वतःच्या टप्प्याटप्प्याने विचार करण्याच्या प्रक्रियेचे वर्णन करते.

दोन्ही लाइव्ह मॉडेल्स सध्या macOS Gemini ॲपवर आणि काही प्रदेशांमध्ये Android वरील Rambler डिक्टेशन फीचरद्वारे इंग्रजीमध्ये उपलब्ध आहेत.

कोणाला फायदा होईल

डेव्हलपर्स कोलॅबोरेशन टूल्स, कंटेंट-क्रिएशन प्लॅटफॉर्म्स आणि व्हॉइस-ड्रिव्हन असिस्टंट्समध्ये “बोलतानाच स्वच्छ करणारे” (clean-as-you-speak) पाइपलाइन समाविष्ट करू शकतात. उद्योग (Enterprises) थेट प्रकाशित करण्यायोग्य ट्रान्सक्रिप्ट्स तयार करू शकतात, ज्यामुळे प्रति मिनिट शुल्क आकारणाऱ्या आणि कडक डेटा-हँडलिंग अटी लादणाऱ्या तृतीय-पक्ष सेवांवरील अवलंबित्व कमी होईल. कंटेंट क्रिएटर्स वेगळ्या एडिटिंग प्रक्रियेविना पॉलिश केलेले कॅप्शन्स प्रकाशित करू शकतात, ज्यामुळे व्हिडिओ आणि पॉडकास्ट तयार करण्याचा वेग वाढेल.

कोणाला फटका बसू शकतो

स्पीकर डायरायझेशन (speaker diarization) आणि तांत्रिक शब्दांच्या (jargon) हाताळणीसाठी प्रीमियम दर आकारणारे विशेष ट्रान्सक्रिप्शन विक्रेते, विशेषतः खर्च-संवेदनशील स्टार्टअप्समध्ये मागणी कमी झाल्याचे पाहू शकतात. मॉडेलची तीन-वक्त्यांची मर्यादा मोठ्या संस्थांना एकाच कॉलमध्ये अधिक सहभागींना सपोर्ट करणाऱ्या समर्पित सोल्यूशन्सकडे वळवू शकते.

मर्यादा आणि उघड्या प्रश्ना

  • वक्त्यांची संख्या – प्रति फाईल केवळ तीन वक्ता ओळखले जाऊ शकतात; मोठ्या पॅनेलच्या मीटिंगसाठी अजूनही बाह्य साधनांची (external tooling) गरज भासेल.
  • भाषेचा विस्तार – बहुभाषिक समर्थनाची घोषणा करण्यात आली आहे, परंतु लाइव्ह मॉडेल्स सध्या केवळ इंग्रजीपुरती मर्यादित आहेत, ज्यामुळे गैर-इंग्रजी वापरकर्त्यांना पूर्ण कार्यक्षमतेसाठी प्रतीक्षा करावी लागेल.
  • गोपनीयता (Privacy) – कोणत्याही क्लाउड-आधारित स्पीच सर्व्हिसप्रमाणेच, उद्योगांना गुगलच्या इन्फ्रास्ट्रक्चरच्या सोयीचा आणि संवेदनशील ऑडिओ बाह्य सर्व्हरवर न ठेवण्याच्या गरजेचा विचार करावा लागेल. गुगलच्या अटी काही ग्राहकांसाठी ऑन-प्रिमाइसेस (on-premise) उपयोजनाची परवानगी देतात, परंतु तो पर्याय अद्याप सार्वजनिक झालेला नाही.

पुढे काय पाहायचे

गुगलने भविष्यातील अपडेट्सचे संकेत दिले आहेत जे वक्त्यांची मर्यादा वाढवतील आणि लाइव्ह मॉडेलची व्याप्ती अतिरिक्त भाषांपर्यंत विस्तारतील. API चे प्राइसिंग टियर्स (pricing tiers) पाहणे देखील आवश्यक असेल; प्रति मिनिट जास्त खर्च उच्च-प्रमाण वापरकर्त्यांसाठी उत्पादकता वाढवण्याच्या फायद्यावर परिणाम करू शकतो. शेवटी, डेव्हलपर्समधील अवलंबनाचा दर (adoption curve) हे स्पष्ट करेल की स्वयंचलित फिलर रिमूव्हलची सोय विशिष्ट शब्दसंग्रहातील उर्वरित त्रुटींपेक्षा जास्त महत्त्वाची आहे की नाही.

निष्कर्ष: Gemini 3.5 Transcribe बोलून रेकॉर्ड केलेल्या ऑडिओला पॉलिश करण्याचे कंटाळवाणे काम एका सिंगल API कॉलमध्ये रूपांतरित करते, ज्यामुळे डेव्हलपर्सना स्वच्छ आणि स्पीकर-टॅग केलेल्या मजकुरासाठी एक तयार टूल उपलब्ध होते. याचे यश Google किती वेगाने भाषेचा सपोर्ट वाढवते, स्पीकरची मर्यादा वाढवते आणि एंटरप्राइझ गोपनीयता (privacy) संबंधी चिंतांचे निराकरण करते यावर अवलंबून आहे.