Ejen suara yang bakal kami lancarkan sering memotong percakapan pemanggil, menyebabkan kadar pemotongan (truncation rate) meningkat sehingga 18% dan memaksa kami menulis semula logik tamat giliran (end-of-turn logic) hanya sepuluh hari sebelum pelancaran. Dengan menambah semakan tatabahasa dan pengesanan back-channel kepada peraturan tamat masa senyap, kami berjaya mengurangkan gangguan kepada 3% dan menghapuskan kesenyapan panjang yang membuatkan sistem terasa tidak responsif.
Mengapa satu tamat masa senyap tidak mencukupi
Reka bentuk asal kami menganggap sebarang jeda selama 700 ms sebagai isyarat bahawa pengguna telah selesai bercakap. Dalam demo terkawal—dengan seorang penutur menyampaikan ayat lengkap dalam bilik yang sunyi—peraturan itu berfungsi dengan baik. Walau bagaimanapun, pemanggil sebenar akan berhenti seketika untuk berfikir, memecahkan nombor kepada kumpulan, dan menyisipkan "uh-huh" atau "mm-hmm" untuk menunjukkan mereka sedang mendengar. Ejen tersebut mentafsirkan setiap jeda itu sebagai tamatnya sesuatu giliran.
Analisis terhadap 312 panggilan produksi mendedahkan dua masalah. Pertama, ejen mencelah semasa penutur masih merangka frasa seterusnya, yang merosakkan 18% daripada giliran perbualan. Kedua, apabila kami menaikkan tamat masa kepada 1500 ms untuk menghentikan gangguan, sistem menjadi lembap dan mula tersekat pada talian yang bising. Bunyi latar terus menetapkan semula pengira senyap, menyebabkan ejen tidak pernah memutuskan bahawa pengguna telah selesai.
Tiga isyarat menggantikan satu angka tunggal
Kami beralih daripada tamat masa tetap dan membina sebuah mesin keadaan (state machine) kecil yang memerhatikan tiga isyarat:
- Durasi senyap – berapa lama pengguna telah diam.
- Tatabahasa – adakah transkrip berakhir dengan unit sintaksis yang lengkap atau perkataan tergantung seperti “the” atau “and”?
- Pengesanan back-channel – adakah bunyi terakhir merupakan giliran sebenar (cth., jawapan lisan) atau pengakuan ringkas seperti “yeah”?
Dengan isyarat ini, kami menetapkan dua bajet senyap:
- Transkrip lengkap – apabila teks yang dianalisis kelihatan selesai, kami menggunakan tamat masa pendek sebanyak 550 ms. Ejen kekal tangkas dan membalas dengan segera.
- Transkrip tergantung – apabila token terakhir menunjukkan pengguna berada di tengah ayat, kami memanjangkan tamat masa kepada 1300 ms, memberi ruang kepada penutur untuk menyambung.
Dua mekanisme kawalan tambahan menghalang gangguan palsu:
- Durasi pertuturan minimum – "mm-hmm" yang ringkas tidak dikira sebagai giliran penuh, jadi ejen menunggu ucapan yang lebih panjang sebelum membuat keputusan.
- Had keras (Hard cap) – tanpa mengira bunyi latar, had senyap maksimum memaksa ejen untuk bertindak balas selepas tempoh yang munasabah, bagi mengelakkan sistem tergantung tanpa henti.
Keputusan dan maknanya untuk AI suara
Selepas kami melaksanakan sistem tiga isyarat ini, kadar pemotongan jatuh daripada 18% kepada 3%. Pemanggil tidak lagi mendengar ejen bercakap menindas mereka, dan masalah "kesenyapan mati" sebelum ini telah lenyap. Ejen terasa responsif dan sopan, selaras dengan cara manusia menguruskan pertukaran giliran perbualan.
Bagi pembangun yang membina pembantu suara, pengajarannya jelas: satu pemalar tunggal dalam fail konfigurasi tidak dapat menangkap nuansa interaksi lisan. Sebuah mesin keadaan yang ringan yang menilai panjang senyap, kelengkapan tatabahasa, dan isyarat back-channel dapat meningkatkan ketepatan pertukaran giliran secara drastik tanpa menambah beban pengkomputeran yang berat.
Keburukan berpotensi dan persoalan terbuka
Penambahan penganalisisan tatabahasa dan pengelasan back-channel menambah langkah pemprosesan. Pasukan mesti memastikan bahawa latensi tambahan tidak menghapuskan kelebihan kelancaran perbualan yang diperoleh. Pendekatan ini juga bergantung kepada transkrip yang agak tepat; dalam persekitaran yang bising atau dengan pertuturan beraksen, isyarat tatabahasa mungkin gagal, memaksa sistem beralih kepada tamat masa yang lebih panjang.
Kerja masa hadapan boleh meneroka ambang tamat masa adaptif yang belajar daripada tabiat pemanggil individu, atau menyepadukan ciri prosodik (pic, tenaga) untuk memperkukuh pengesan back-channel. Memantau bagaimana penambahbaikan ini mempengaruhi metrik utama—kepuasan pelanggan, masa penyelesaian panggilan, dan kadar ralat—adalah penting sebelum menskalakan teknik ini kepada peluncuran pusat panggilan yang lebih besar.
Rumusan: Menganggap penyelesaian giliran sebagai keputusan berbilang isyarat, dan bukannya pemasa senyap tunggal, mengurangkan ralat gangguan secara drastik dan mengembalikan aliran semula jadi yang diharapkan pengguna daripada ejen suara.
