گوگل روز سهشنبه Gemini 3.5 Transcribe را عرضه کرد. این مدل تبدیل گفتار به متن، کلمات پرکننده (filler words) را حذف میکند، به واژگان ارائهشده توسط کاربر احترام میگذارد و تا سه گوینده را در یک ضبط واحد برچسبگذاری میکند. این سرویس با تبدیل صوت خام به متن صیقلخورده و ساختاریافته بدون نیاز به ویرایشگر انسانی، زمان صرفشده توسط توسعهدهندگان برای پاکسازی متنهای پیادهسازیشده جهت یادداشتهای جلسات، پروندههای حقوقی و موارد دیگر را کاهش میدهد.
چرا گوگل اکنون این اقدام را انجام داد
پشته پردازش صوتی گوگل سالهاست که در حال تکامل است، اما محصول قبلی آن، Chirp 3، همچنان در مواجهه با مکثها، اصطلاحات فنی و تغییر گوینده دچار مشکل بود. دورکاری و پادکستسازی بازار پیادهسازی متن (transcription) را گسترش دادهاند، با این حال بسیاری از شرکتها هنوز به پردازش دستی پس از ضبط یا فروشندگان گرانقیمت و تخصصی متکی هستند. Gemini 3.5 Transcribe به این نقطه اصطکاک پاسخ میدهد: مدلی که نه تنها گفتار را تشخیص میدهد، بلکه آن را در لحظه ویرایش نیز میکند.
مدل جدید دقیقاً چه کاری انجام میدهد
- حذف خودکار کلمات پرکننده – کلماتی مانند "um" و "uh" و تپقهای مشابه همزمان با تولید متن حذف میشوند و خروجی تمیزتری باقی میماند.
- واژگان سفارشی – کاربران فهرستی از کلمات تخصصی حوزه خود را آپلود میکنند تا از «اصلاح» آنها توسط مدل به اصطلاحات عمومی جلوگیری شود. این موضوع برای حوزههایی که پر از مخففها، نام محصولات یا املایهای خارجی هستند، اهمیت زیادی دارد.
- تشخیص گوینده – سیستم تا سه صدای متمایز را شناسایی کرده، به هر گفته یک برچسب گوینده اختصاص میدهد و یک برچسب زمانی در سطح کلمه اضافه میکند. تیمهای حقوقی، کاتبهای پزشکی و روزنامهنگاران میتوانند سوابق دارای کد زمانی را مستقیماً از فایل اصلی تهیه کنند.
- پوشش چندزبانه – گوگل مدعی بهبود دقت در بیش از ۸۵ زبان است که گامی رو به جلو نسبت به مجموعه محدودتر نسل قبلی محسوب میشود.
تمام این قابلیتها در قالب یک API با تمرکز بر توسعهدهندگان ارائه شدهاند. اپلیکیشنها درخواست متن میکنند و یک JSON payload دریافت میکنند که از قبل شامل متن پاکسازیشده، برچسبهای گوینده و برچسبهای زمانی است.
عرضه گستردهتر صوتی Gemini
Gemini 3.5 Transcribe متعلق به خانواده گستردهتری از مدلهای صوتی است:
- Gemini 3.5 Live – بهینهسازی شده برای تعامل در لحظه، این مدل وقفههای میان جمله را بهتر از مدلهای زنده قبلی مدیریت میکند.
- Gemini 3.5 Live Experimental – یک نسخه با سطح استدلال بالاتر که هنگام حل وظایف پیچیده، مراحل تفکر گامبهگام خود را روایت میکند.
هر دو مدل زنده در حال حاضر به زبان انگلیسی در اپلیکیشن Gemini برای macOS و از طریق ویژگی دیکته Rambler در اندروید در مناطق محدودی در دسترس هستند.
چه کسانی سود خواهند برد
توسعهدهندگان میتوانند یک خط لوله (pipeline) «پاکسازی همزمان با صحبت کردن» را در ابزارهای همکاری، پلتفرمهای تولید محتوا و دستیارهای صوتی بگنجانند. شرکتها میتوانند متنهای آماده برای انتشار تولید کنند و وابستگی خود را به خدمات شخص ثالث که بر اساس دقیقه هزینه دریافت میکنند و بندهای سختگیرانهای برای مدیریت دادهها دارند، کاهش دهند. تولیدکنندگان محتوا میتوانند زیرنویسهای صیقلخورده را بدون نیاز به مرحله ویرایش جداگانه منتشر کنند و سرعت تولید ویدیو و پادکست را افزایش دهند.
چه کسانی ممکن است آسیب ببینند
فروشندگان تخصصی پیادهسازی متن که برای تشخیص گوینده (speaker diarization) و مدیریت اصطلاحات تخصصی نرخهای بالایی دریافت میکنند، ممکن است با کاهش تقاضا مواجه شوند، بهویژه در میان استارتآپهای حساس به هزینه. محدودیت سه گوینده در این مدل همچنین ممکن است سازمانهای بزرگتر را به سمت راهکارهای اختصاصی که از شرکتکنندگان بیشتری در یک تماس واحد پشتیبانی میکنند، سوق دهد.
محدودیتها و پرسشهای بیپاسخ
- تعداد گویندگان – در هر فایل تنها سه گوینده قابل تشخیص است؛ جلساتی با پنلهای بزرگتر همچنان به ابزارهای خارجی نیاز خواهند داشت.
- عرضه زبانی – پشتیبانی چندزبانه اعلام شده است، اما مدلهای زنده همچنان فقط انگلیسی هستند و کاربران غیرانگلیسیزبان باید منتظر عملکرد کامل بمانند.
- حریم خصوصی – مانند هر سرویس گفتاری مبتنی بر ابری، شرکتها باید راحتی زیرساخت گوگل را در مقابل نیاز به دور نگه داشتن صداهای حساس از سرورهای خارجی بسنجند. شرایط گوگل اجازه استقرار در محل (on-premise) را برای مشتریان خاصی میدهد، اما این گزینه هنوز عمومی نشده است.
آنچه باید در آینده زیر نظر داشت
گوگل به بهروزرسانیهای آینده اشاره کرده است که سقف تعداد گویندگان را افزایش داده و پوشش مدلهای زنده را به زبانهای بیشتری گسترش میدهد. زیر نظر گرفتن سطوح قیمتگذاری API نیز ضروری خواهد بود؛ هزینه بالای هر دقیقه میتواند سود حاصل از بهرهوری را برای کاربران با حجم بالا از بین ببرد. در نهایت، منحنی پذیرش در میان توسعهدهندگان مشخص خواهد کرد که آیا راحتیِ حذف خودکار کلمات پرکننده بر خطاهای باقیمانده در واژگان تخصصی غلبه میکند یا خیر.
نکته کلیدی: Gemini 3.5 Transcribe کار خستهکننده اصلاح ضبطهای صوتی را به یک فراخوانی واحد API تبدیل میکند و ابزاری آماده برای دستیابی به متنی تمیز و دارای برچسب گوینده در اختیار توسعهدهندگان قرار میدهد. موفقیت آن به این بستگی دارد که گوگل با چه سرعتی پشتیبانی از زبانها را گسترش دهد، محدودیت تعداد گویندگان را افزایش دهد و به نگرانیهای مربوط به حریم خصوصی در سطح سازمانی رسیدگی کند.
