Google એ મંગળવારે Gemini 3.5 Transcribe લોન્ચ કર્યું. આ speech-to-text મોડેલ ફિલર શબ્દો (filler words) દૂર કરે છે, વપરાશકર્તા દ્વારા આપવામાં આવેલી શબ્દાવલિ (vocabularies) ને માન આપે છે અને એક જ રેકોર્ડિંગમાં ત્રણ વક્તાઓ સુધીને ટેગ કરે છે. માનવ સંપાદક વગર કાચા ઓડિયોને સુધારેલા, વ્યવસ્થિત ટેક્સ્ટમાં ફેરવીને, આ સેવા મીટિંગ નોંધો, કાનૂની ફાઇલિંગ અને અન્ય બાબતો માટે ટ્રાન્સક્રિપ્ટ્સને સાફ કરવામાં ડેવલપર્સનો જે સમય જાય છે તેને ઘટાડે છે.

Google એ અત્યારે આ નિર્ણય કેમ લીધો

Google નું ઓડિયો-પ્રોસેસિંગ સ્ટેક વર્ષોથી વિકસી રહ્યું છે, પરંતુ તેની અગાઉની ઓફરિંગ, Chirp 3, હજુ પણ વિરામ (pauses), ટેકનિકલ શબ્દો અને વક્તાઓના બદલાવમાં અટકી જતી હતી. રિમોટ વર્ક અને પોડકાસ્ટિંગથી ટ્રાન્સક્રિપ્શન માર્કેટમાં મોટો વધારો થયો છે, તેમ છતાં ઘણા સાહસો (enterprises) હજુ પણ મેન્યુઅલ પોસ્ટ-પ્રોસેસિંગ અથવા મોંઘા નિશ (niche) વેન્ડર્સ પર આધાર રાખે છે. Gemini 3.5 Transcribe તે સમસ્યાનો ઉકેલ આપે છે: એક એવું મોડેલ જે માત્ર ભાષણને ઓળખતું જ નથી પરંતુ તેને તરત જ (on the fly) એડિટ પણ કરે છે.

નવું મોડેલ ખરેખર શું કરે છે

  • Automatic filler-word removal – ટ્રાન્સક્રિપ્ટ જનરેટ થતી વખતે “um”, “uh” અને સમાન અસ્પષ્ટ શબ્દો આપમેળે દૂર થઈ જાય છે, જેનાથી વધુ સ્પષ્ટ લખાણ મળે છે.
  • Custom vocabularies – વપરાશકર્તાઓ ડોમેન-વિશિષ્ટ શબ્દોની યાદી અપલોડ કરી શકે છે, જે મોડેલને તેમને સામાન્ય શબ્દોમાં "સુધારતા" અટકાવે છે. આ બાબત એવા ક્ષેત્રો માટે મહત્વપૂર્ણ છે જ્યાં અક્રોનિમ્સ (acronyms), પ્રોડક્ટના નામ અથવા વિદેશી જોડણીઓનો ઉપયોગ વધુ હોય છે.
  • Speaker attribution – સિસ્ટમ ત્રણ અલગ-અલગ અવાજોને ઓળખી શકે છે, દરેક વાક્યને વક્તાનું લેબલ આપે છે અને શબ્દ-સ્તરના ટાઈમસ્ટેમ્પ ઉમેરે છે. કાનૂની ટીમો, મેડિકલ સ્ક્રાઇબ્સ અને પત્રકારો સીધી સોર્સ ફાઇલમાંથી ટાઈમ-કોડેડ રેકોર્ડ્સ તૈયાર કરી શકે છે.
  • Multilingual reach – Google એ 85 થી વધુ ભાષાઓમાં સુધારેલી ચોકસાઈનો દાવો કર્યો છે, જે તેના અગાઉના મોડેલ કરતા ઘણું વધારે છે.

આ તમામ ક્ષમતાઓ ડેવલપર-કેન્દ્રિત API દ્વારા ઉપલબ્ધ છે. એપ્સ ટ્રાન્સક્રિપ્ટ માટે વિનંતી કરે છે અને JSON પેલોડ મેળવે છે જેમાં પહેલેથી જ સાફ કરેલ ટેક્સ્ટ, સ્પીકર ટેગ્સ અને ટાઈમસ્ટેમ્પ હોય છે.

Gemini ઓડિયો રોલઆઉટનું વ્યાપક સ્વરૂપ

Gemini 3.5 Transcribe એ ઓડિયો મોડેલ્સના વ્યાપક પરિવારનો એક ભાગ છે:

  • Gemini 3.5 Live – રિયલ-ટાઇમ ઇન્ટરેક્શન માટે ઓપ્ટિમાઇઝ કરેલ, તે અગાઉના લાઈવ મોડેલ્સ કરતા વાક્યની વચ્ચે આવતા વિક્ષેપોને વધુ સારી રીતે સંભાળે છે.
  • Gemini 3.5 Live Experimental – એક ઉચ્ચ-સ્તરનું રીઝનિંગ વેરિઅન્ટ જે જટિલ કાર્યો ઉકેલતી વખતે તેની પોતાની સ્ટેપ-બાય-સ્ટેપ વિચાર પ્રક્રિયાનું વર્ણન કરે છે.

બંને લાઈવ મોડેલ્સ હાલમાં macOS Gemini એપ પર અને કેટલાક પ્રદેશોમાં Android પર Rambler ડિક્ટેશન ફીચર દ્વારા અંગ્રેજીમાં ઉપલબ્ધ છે.

કોને ફાયદો થઈ શકે છે

ડેવલપર્સ કોલેબોરેશન ટૂલ્સ, કન્ટેન્ટ-ક્રિએશન પ્લેટફોર્મ્સ અને વોઈસ-ડ્રિવન આસિસ્ટન્ટ્સમાં “clean-as-you-speak” પાઇપલાઇન ઉમેરી શકે છે. સાહસો (Enterprises) તૈયાર-ટુ-પબ્લિશ ટ્રાન્સક્રિપ્ટ્સ જનરેટ કરી શકે છે, જેનાથી પ્રતિ મિનિટ ચાર્જ લેતી અને કડક ડેટા-હેન્ડલિંગ શરતો લાદતી તૃતીય-પક્ષ સેવાઓ પરની નિર્ભરતા ઘટે છે. કન્ટેન્ટ ક્રિએટર્સ અલગથી એડિટિંગ કર્યા વગર સુધારેલા કેપ્શન પ્રકાશિત કરી શકે છે, જેનાથી વિડિયો અને પોડકાસ્ટના કામમાં ઝડપ આવશે.

કોને અસર થઈ શકે છે

સ્પીકર ડાયરાઇઝેશન (speaker diarization) અને જાર્ગન (jargon) હેન્ડલિંગ માટે પ્રીમિયમ રેટ લેતા સ્પેશિયાલિસ્ટ ટ્રાન્સક્રિપ્શન વેન્ડર્સની માંગમાં ઘટાડો થઈ શકે છે, ખાસ કરીને ખર્ચ-સંવેદનશીલ સ્ટાર્ટઅપ્સમાં. મોડેલની ત્રણ-વક્તાની મર્યાદા મોટી સંસ્થાઓને એવા સમર્પિત સોલ્યુશન્સ તરફ પણ ધકેલી શકે છે જે એક જ કોલમાં વધુ સહભાગીઓને સપોર્ટ કરે છે.

મર્યાદાઓ અને ખુલ્લા પ્રશ્નો

  • Speaker count – દરેક ફાઇલમાં માત્ર ત્રણ વક્તાઓને જ અલગ કરી શકાય છે; મોટા પેનલ ધરાવતી મીટિંગ્સ માટે હજુ પણ બાહ્ય સાધનોની જરૂર પડશે.
  • Language rollout – બહુભાષી સપોર્ટની જાહેરાત કરવામાં આવી છે, પરંતુ લાઈવ મોડેલ્સ માત્ર અંગ્રેજીમાં જ છે, જેના કારણે બિન-અંગ્રેજી વપરાશકર્તાઓને સંપૂર્ણ કાર્યક્ષમતા માટે રાહ જોવી પડશે.
  • Privacy – કોઈપણ ક્લાઉડ-આધારિત સ્પીચ સર્વિસની જેમ, સાહસોએ સંવેદનશીલ ઓડિયોને બાહ્ય સર્વર્સથી દૂર રાખવાની જરૂરિયાત સામે Google ના ઇન્ફ્રાસ્ટ્રક્ચરની સુવિધાને તોલવી પડશે. Google ની શરતો અમુક ગ્રાહકો માટે ઓન-પ્રેમિસ ડિપ્લોયમેન્ટની મંજૂરી આપે છે, પરંતુ તે વિકલ્પ હજુ સુધી જાહેર કરવામાં આવ્યો નથી.

આગળ શું જોવું

Google એ ભવિષ્યના અપડેટ્સનો સંકેત આપ્યો છે જે વક્તાઓની સંખ્યા વધારશે અને લાઈવ મોડેલના કવરેજને વધારાની ભાષાઓમાં વિસ્તૃત કરશે. API ના પ્રાઇસિંગ સ્તરો પર નજર રાખવી પણ આવશ્યક રહેશે; પ્રતિ મિનિટનો ઊંચો ખર્ચ વધુ પ્રમાણમાં ઉપયોગ કરતા વપરાશકર્તાઓ માટે ઉત્પાદકતાના ફાયદા ઘટાડી શકે છે. અંતે, ડેવલપર્સમાં આ ટેકનોલોજીનો સ્વીકાર એ દર્શાવશે કે ઓટોમેટિક ફિલર રિમૂવલની સુવિધા વિશિષ્ટ શબ્દાવલિમાં રહેલી કોઈપણ બાકી રહેલી ભૂલો કરતા વધુ મહત્વની છે કે નહીં.

મુખ્ય સારાંશ: Gemini 3.5 Transcribe બોલાયેલી રેકોર્ડિંગ્સને સુધારવાના કંટાળાજનક કાર્યને એક સિંગલ API કોલમાં પરિવર્તિત કરે છે, જે ડેવલપર્સને સ્વચ્છ અને સ્પીકર-ટેગ્ડ ટેક્સ્ટ માટે તૈયાર સાધન પૂરું પાડે છે. તેની સફળતા એ બાબત પર નિર્ભર છે કે Google કેટલી ઝડપથી ભાષાકીય સપોર્ટનું વિસ્તરણ કરે છે, સ્પીકરની મર્યાદા વધારે છે અને એન્ટરપ્રાઇઝ પ્રાઇવસી સંબંધિત ચિંતાઓનું નિરાકરણ લાવે છે.