أطلقت Google نموذج Gemini 3.5 Transcribe يوم الثلاثاء. يقوم نموذج تحويل الكلام إلى نص بإزالة الكلمات الحشوية، واحترام المفردات التي يزودها المستخدم، وتحديد ما يصل إلى ثلاثة متحدثين في التسجيل الواحد. ومن خلال تحويل الصوت الخام إلى نص مصقول ومنظم دون الحاجة إلى محرر بشري، يقلل هذا النموذج من الوقت الذي يقضيه المطورون في تنقية النصوص المفرغة لملاحظات الاجتماعات، والوثائق القانونية، وغيرها.
لماذا اتخذت Google هذه الخطوة الآن
لقد كانت حزمة معالجة الصوت من Google تتطور لسنوات، لكن عرضها السابق، Chirp 3، كان لا يزال يتعثر عند التوقفات، والمصطلحات التقنية، وتبديل المتحدثين. وقد أدى العمل عن بُعد والبودكاست إلى تضخم سوق التفريغ الصوتي، ومع ذلك لا تزال العديد من الشركات تعتمد على المعالجة اللاحقة اليدوية أو الموردين المتخصصين ذوي التكلفة العالية. ويأتي Gemini 3.5 Transcribe ليحل نقطة الاحتكاك تلك: نموذج لا يكتفي بالتعرف على الكلام فحسب، بل يقوم بتحريره أيضًا أثناء العمل.
ما الذي يفعله النموذج الجديد فعليًا
- إزالة تلقائية للكلمات الحشوية – تختفي كلمات مثل "اممم" و"آه" والاضطرابات اللفظية المماثلة أثناء إنشاء النص المفرغ، مما يترك نصًا أكثر وضوحًا.
- مفردات مخصصة – يقوم المستخدمون بتحميل قائمة بالكلمات الخاصة بمجال معين، مما يمنع النموذج من "تصحيحها" إلى مصطلحات عامة. وهذا أمر بالغ الأهمية للمجالات المليئة بالاختصارات، أو أسماء المنتجات، أو التهجئات الأجنبية.
- تحديد هوية المتحدث – يحدد النظام ما يصل إلى ثلاثة أصوات متميزة، ويخصص لكل عبارة تسمية للمتحدث، ويضيف طابعًا زمنيًا على مستوى الكلمة. يمكن للفرق القانونية، والكتبة الطبيين، والصحفيين إنتاج سجلات مشفرة زمنيًا مباشرة من ملف المصدر.
- انتشار متعدد اللغات – تدعي Google تحسين الدقة عبر أكثر من 85 لغة، وهي خطوة للأمام مقارنة بالمجموعة المحدودة التي قدمها سلفها.
تتوفر كل هذه القدرات من خلال API مخصص للمطورين. تطلب التطبيقات نصًا مفرغًا وتتلقى حمولة JSON تحتوي بالفعل على النص المنقى، وعلامات المتحدثين، والطوابع الزمنية.
التوسع الأوسع لنماذج Gemini الصوتية
ينتمي Gemini 3.5 Transcribe إلى عائلة أوسع من النماذج الصوتية:
- Gemini 3.5 Live – مُحسَّن للتفاعل في الوقت الفعلي، ويتعامل مع المقاطعات أثناء الجمل بشكل أفضل من النماذج الحية السابقة.
- Gemini 3.5 Live Experimental – نسخة متطورة من حيث الاستنتاج، تقوم بسرد تفكيرها خطوة بخطوة أثناء حل المهام المعقدة.
يتوفر كلا النموذجين الحيّين حاليًا باللغة الإنجليزية على تطبيق Gemini لنظام macOS ومن خلال ميزة الإملاء Rambler على نظام Android في عدد قليل من المناطق.
المستفيدون من هذه التقنية
يمكن للمطورين دمج مسار عمل "التنقية أثناء التحدث" في أدوات التعاون، ومنصات إنشاء المحتوى، والمساعدات الصوتية. ويمكن للشركات إنشاء نصوص مفرغة جاهزة للنشر، مما يقلل الاعتماد على خدمات الطرف الثالث التي تفرض رسومًا لكل دقيقة وتضع شروطًا صارمة لمعالجة البيانات. كما يمكن لمنشئي المحتوى نشر تسميات توضيحية (captions) مصقولة دون الحاجة إلى عملية تحرير منفصلة، مما يسرع من وتيرة إنتاج الفيديو والبودكاست.
من قد يتأثر سلباً
قد يشهد موردو التفريغ الصوتي المتخصصون، الذين يفرضون أسعارًا مرتفعة مقابل ميزات تحديد هوية المتحدثين والتعامل مع المصطلحات المتخصصة، انخفاضًا في الطلب، خاصة بين الشركات الناشئة الحريصة على التكاليف. كما قد يدفع حد الثلاثة متحدثين للنموذج المؤسسات الكبيرة نحو الحلول المخصصة التي تدعم عددًا أكبر من المشاركين في المكالمة الواحدة.
القيود والأسئلة المفتوحة
- عدد المتحدثين – يمكن تمييز ثلاثة متحدثين فقط لكل ملف؛ لذا ستظل الاجتماعات التي تضم لجانًا أكبر بحاجة إلى أدوات خارجية.
- إطلاق اللغات – تم الإعلان عن دعم لغات متعددة، لكن النماذج الحية لا تزال تقتصر على اللغة الإنجليزية فقط، مما يترك المستخدمين غير الناطقين بالإنجليزية في انتظار الوظائف الكاملة.
- الخصوصية – كما هو الحال مع أي خدمة كلام قائمة على السحابة، يجب على الشركات الموازنة بين سهولة البنية التحتية لشركة Google والحاجة إلى إبقاء الملفات الصوتية الحساسة بعيدًا عن الخوادم الخارجية. تسمح شروط Google بالنشر في الموقع (on-premise) لبعض العملاء، لكن هذا الخيار ليس متاحًا للعامة بعد.
ما الذي يجب مراقبته لاحقًا
ألمحت Google إلى تحديثات مستقبلية سترفع الحد الأقصى لعدد المتحدثين وتوسع نطاق تغطية النماذج الحية لتشمل لغات إضافية. كما سيكون مراقبة فئات تسعير الـ API أمرًا ضروريًا؛ إذ يمكن أن تؤدي التكلفة المرتفعة لكل دقيقة إلى تآكل مكاسب الإنتاجية للمستخدمين ذوي الاستخدام الكثيف. وأخيرًا، سيكشف منحنى التبني بين المطورين ما إذا كانت سهولة الإزالة التلقائية للكلمات الحشوية تفوق أي أخطاء متبقية في المفردات المتخصصة.
الخلاصة: يحول Gemini 3.5 Transcribe المهمة الشاقة المتمثلة في تنقيح التسجيلات الصوتية إلى استدعاء واحد لـ API، مما يمنح المطورين أداة جاهزة للحصول على نصوص نظيفة ومصنفة حسب المتحدث. ويتوقف نجاحه على مدى سرعة قيام Google بتوسيع دعم اللغات، ورفع الحد الأقصى لعدد المتحدثين، ومعالجة مخاوف الخصوصية في المؤسسات.
