ทีม Voice-AI ประกาศว่าพวกเขาสามารถลดความหน่วงในการตอบสนองแบบ end-to-end ของการโทรศัพท์จริงให้เหลือต่ำกว่า 1.8 วินาที ซึ่งลดลงถึง 55% จากตัวต้นแบบรุ่นแรก การใช้กระบวนการประมวลผลแบบซ้อนทับกัน (overlapping processing streams), ตัวตรวจจับกิจกรรมเสียงแบบนิวรัล (neural voice-activity detector), การสังเคราะห์เสียงจากข้อความแบบสตรีมมิ่ง (streaming text-to-speech synthesis) และการดึงข้อมูลความตั้งใจล่วงหน้าแบบคาดการณ์ (speculative intent pre-fetching) คือปัจจัยสำคัญที่ช่วยเพิ่มประสิทธิภาพและทำให้อัตราการเปลี่ยนเป็นนัดหมาย (appointment conversion rates) เพิ่มขึ้นประมาณ 30%
ทำไมความหน่วงจึงสำคัญสำหรับผู้ช่วยเสียง
การหยุดเว้นช่วงนานๆ ทำให้ผู้โทรสงสัยว่าระบบยังฟังอยู่หรือไม่ ในการทดสอบช่วงแรก ตัวต้นแบบต้องรอถึง 2.9 วินาทีก่อนจะตอบกลับ ทำให้ผู้โทรต้องพูดซ้ำหรือวางสายไป ซึ่งเป็นสัญญาณที่ชัดเจนว่าความล่าช้ากำลังทำลายความต่อเนื่องในการสนทนา สำหรับบริการแบบเรียลไทม์ใดๆ ไม่ว่าจะเป็นฝ่ายสนับสนุนลูกค้า การจอง หรือการค้นหาข้อมูล ทุกวินาทีที่เงียบไปจะบั่นทอนความเชื่อมั่นและลดอัตราการดำเนินการของผู้ใช้
การปรับแต่งทางเทคนิคที่ช่วยลดเวลาลงได้หนึ่งวินาที
ทีมงานได้เปลี่ยนจากการใช้กระบวนการแบบลำดับขั้นตอนที่เคร่งครัด (strictly sequential pipeline) มาเป็นการให้แต่ละขั้นตอนทำงานแบบขนาน (parallel) โดยจะส่งข้อมูลไปยังขั้นตอนถัดไปทันทีที่มีข้อมูลเพียงพอ
- การตรวจจับกิจกรรมเสียงแบบนิวรัล (Neural voice-activity detection หรือ VAD): โมเดลนิวรัลขนาดเล็กจะคอยตรวจสอบสตรีมเสียงและคาดการณ์ว่าผู้พูดจะจบประโยคเมื่อใด ซึ่งช่วยลดช่วงเวลาในการตรวจจับจากประมาณ 800 มิลลิวินาที เหลือเพียง 280 มิลลิวินาที
- การสังเคราะห์เสียงจากข้อความแบบสตรีมมิ่ง (Streaming text-to-speech หรือ TTS): แทนที่จะต้องรอคำตอบที่เป็นข้อความทั้งหมด ระบบจะส่งวลีแรกไปยังตัวสังเคราะห์เสียงทันที เพื่อให้เสียงเริ่มทำงานในขณะที่ส่วนที่เหลือของคำตอบกำลังถูกสร้างขึ้น
- การดึงข้อมูลความตั้งใจล่วงหน้าแบบคาดการณ์ (Speculative intent pre-fetching): ในขณะที่ผู้ใช้ยังคงพูดอยู่ โมเดลจะคาดการณ์ความตั้งใจที่น่าจะเป็นไปได้และทำการสอบถามข้อมูลไปยังระบบหลังบ้าน (backend) ไว้ล่วงหน้า หากการคาดการณ์ถูกต้อง คำตอบจะพร้อมทันทีที่ผู้พูดพูดจบ แต่หากคาดการณ์ผิด ระบบสำรอง (fallback) ก็ยังสามารถส่งคำตอบมาได้อย่างรวดเร็ว
สิ่งที่ตัวเลขบ่งชี้และสิ่งที่ต้องจับตามองต่อไป
ด้วยการออกแบบที่เน้นการทำงานแบบซ้อนทับกัน เวลาในการตอบสนองทั้งหมดจึงลดลงต่ำกว่า 1.8 วินาที และอัตราการเปลี่ยนเป็นนัดหมายเพิ่มขึ้น 30%
อย่างไรก็ตาม แนวทางนี้เพิ่มความซับซ้อนขึ้น: การทำงานแบบสตรีมขนานและการสอบถามแบบคาดการณ์ต้องใช้ทรัพยากรการประมวลผลมากขึ้น และต้องการการจัดการข้อผิดพลาด (error handling) ที่ระมัดระวังเมื่อการคาดการณ์ผิดพลาด ทีมงานที่ต้องการใช้แนวทางเดียวกันนี้ต้องชั่งน้ำหนักระหว่างต้นทุนด้านฮาร์ดแวร์กับความคาดหวังในการเพิ่มการมีส่วนร่วมของผู้ใช้ (user engagement) ที่จะได้รับ
