Google เปิดตัว Gemini 3.5 Transcribe เมื่อวันอังคารที่ผ่านมา โมเดล speech-to-text นี้จะตัดคำเติม (filler words) ออก รองรับคำศัพท์ที่ผู้ใช้กำหนด และระบุตัวตนผู้พูดได้สูงสุดสามคนในการบันทึกเสียงเพียงครั้งเดียว ด้วยการเปลี่ยนเสียงดิบให้เป็นข้อความที่ขัดเกลาและมีโครงสร้างโดยไม่ต้องใช้บรรณาธิการที่เป็นมนุษย์ บริการนี้จึงช่วยลดเวลาที่นักพัฒนาต้องใช้ในการทำความสะอาดข้อความถอดความ (transcripts) สำหรับบันทึกการประชุม เอกสารทางกฎหมาย และอื่นๆ
ทำไม Google ถึงตัดสินใจเปิดตัวตอนนี้
ชุดเทคโนโลยีการประมวลผลเสียง (audio-processing stack) ของ Google มีการพัฒนามานานหลายปี แต่บริการก่อนหน้านี้อย่าง Chirp 3 ยังคงมีปัญหาเมื่อเจอการเว้นจังหวะ คำศัพท์ทางเทคนิค และการสลับผู้พูด การทำงานทางไกลและพอดแคสต์ทำให้ตลาดการถอดความเติบโตขึ้นอย่างมาก แต่หลายองค์กรยังคงต้องพึ่งพาการประมวลผลหลังการบันทึกด้วยตนเอง หรือใช้บริการจากผู้ให้บริการเฉพาะทางที่มีราคาสูง Gemini 3.5 Transcribe จึงเข้ามาตอบโจทย์จุดที่ติดขัดนั้น ด้วยการเป็นโมเดลที่ไม่เพียงแต่จดจำเสียงพูด แต่ยังสามารถแก้ไขข้อความได้ทันที (on the fly)
สิ่งที่โมเดลใหม่ทำได้จริง ๆ
- การลบคำเติมโดยอัตโนมัติ – คำว่า “um”, “uh” และคำที่ไม่ต่อเนื่องอื่น ๆ จะหายไปในขณะที่กำลังสร้างข้อความถอดความ ทำให้ได้ข้อความที่อ่านง่ายและสะอาดตาขึ้น
- คำศัพท์เฉพาะทาง (Custom vocabularies) – ผู้ใช้สามารถอัปโหลดรายการคำศัพท์เฉพาะด้าน เพื่อป้องกันไม่ให้โมเดล "แก้ไข" คำเหล่านั้นให้กลายเป็นคำทั่วไป ซึ่งสำคัญมากสำหรับสาขาที่มีคำย่อ ชื่อผลิตภัณฑ์ หรือการสะกดคำภาษาต่างประเทศจำนวนมาก
- การระบุตัวตนผู้พูด (Speaker attribution) – ระบบสามารถแยกแยะเสียงที่แตกต่างกันได้สูงสุดสามเสียง โดยจะระบุป้ายชื่อผู้พูดในแต่ละประโยคและเพิ่มการประทับเวลา (timestamp) ในระดับคำ ทีมกฎหมาย ผู้บันทึกทางการแพทย์ และนักข่าว สามารถสร้างบันทึกที่มีการระบุเวลาได้โดยตรงจากไฟล์ต้นฉบับ
- การรองรับหลายภาษา – Google อ้างว่ามีความแม่นยำเพิ่มขึ้นในมากกว่า 85 ภาษา ซึ่งถือเป็นการยกระดับจากชุดภาษาที่จำกัดของโมเดลรุ่นก่อนหน้า
ความสามารถทั้งหมดนี้ทำงานผ่าน API ที่เน้นนักพัฒนาเป็นหลัก แอปพลิเคชันสามารถร้องขอข้อความถอดความและรับข้อมูลในรูปแบบ JSON payload ซึ่งประกอบด้วยข้อความที่ผ่านการทำความสะอาดแล้ว ป้ายระบุผู้พูด และการประทับเวลา
การเปิดตัวโมเดลเสียงในตระกูล Gemini ที่กว้างขึ้น
Gemini 3.5 Transcribe เป็นส่วนหนึ่งของตระกูลโมเดลเสียงที่กว้างขึ้น:
- Gemini 3.5 Live – ปรับแต่งมาเพื่อการโต้ตอบแบบเรียลไทม์ โดยสามารถจัดการกับการขัดจังหวะระหว่างประโยคได้ดีกว่าโมเดลแบบ live รุ่นก่อน ๆ
- Gemini 3.5 Live Experimental – โมเดลรูปแบบการใช้เหตุผลระดับสูงที่สามารถบรรยายกระบวนการคิดทีละขั้นตอนของตัวเองในขณะที่กำลังแก้โจทย์ที่ซับซ้อน
โมเดลแบบ live ทั้งสองรุ่นเปิดให้ใช้งานในภาษาอังกฤษแล้วบนแอป Gemini สำหรับ macOS และผ่านฟีเจอร์การเขียนตามคำบอก (dictation) ของ Rambler บน Android ในบางภูมิภาค
ใครที่จะได้รับประโยชน์
นักพัฒนาสามารถฝังกระบวนการ "ทำความสะอาดขณะพูด" (clean-as-you-speak) ลงในเครื่องมือสำหรับการทำงานร่วมกัน แพลตฟอร์มการสร้างคอนเทนต์ และผู้ช่วยสั่งการด้วยเสียง องค์กรต่าง ๆ สามารถสร้างข้อความถอดความที่พร้อมใช้งานได้ทันที ช่วยลดการพึ่งพาบริการจากบุคคลที่สามที่คิดค่าบริการเป็นรายนาทีและมีข้อกำหนดการจัดการข้อมูลที่เข้มงวด ส่วนผู้สร้างคอนเทนต์ก็สามารถเผยแพร่คำบรรยาย (captions) ที่ขัดเกลาแล้วได้โดยไม่ต้องผ่านขั้นตอนการแก้ไขแยกต่างหาก ช่วยให้การผลิตวิดีโอและพอดแคสต์รวดเร็วยิ่งขึ้น
ใครที่อาจได้รับผลกระทบ
ผู้ให้บริการถอดความเฉพาะทางที่คิดค่าบริการในราคาสูงสำหรับการแยกแยะผู้พูด (speaker diarization) และการจัดการคำศัพท์เฉพาะทาง อาจเห็นความต้องการที่ลดลง โดยเฉพาะในกลุ่มสตาร์ทอัพที่ให้ความสำคัญกับเรื่องต้นทุน นอกจากนี้
สรุปประเด็นสำคัญ: Gemini 3.5 Transcribe เปลี่ยนงานที่น่าเบื่อหน่ายในการปรับแต่งไฟล์บันทึกเสียงให้กลายเป็นการเรียกใช้ API เพียงครั้งเดียว มอบเครื่องมือสำเร็จรูปให้นักพัฒนาเพื่อสร้างข้อความที่สะอาดและมีการระบุตัวตนผู้พูด ความสำเร็จของเครื่องมือนี้ขึ้นอยู่กับความรวดเร็วที่ Google จะขยายการรองรับภาษา เพิ่มขีดจำกัดจำนวนผู้พูด และจัดการกับข้อกังวลด้านความเป็นส่วนตัวของระดับองค์กร
