Sebuah pasukan AI suara mengumumkan bahawa mereka telah berjaya mengurangkan latensi respons hujung-ke-hujung dalam panggilan telefon sebenar kepada bawah 1.8 saat—penurunan sebanyak 55% daripada prototaip pertama mereka. Aliran pemprosesan bertindih, pengesan aktiviti suara neural, sintesis teks-ke-suara penstriman, dan pra-pemuatan niat spekulatif telah memacu peningkatan ini serta menaikkan kadar penukaran janji temu sebanyak kira-kira 30%.

Mengapa latensi penting untuk pembantu suara

Jeda yang lama membuatkan pemanggil tertanya-tanya sama ada sistem masih mendengar. Dalam ujian awal, prototaip tersebut menunggu selama 2.9 saat sebelum menjawab. Pemanggil mengulang semula kata-kata mereka atau menamatkan panggilan, satu tanda jelas bahawa kelengahan tersebut mengganggu aliran perbualan. Bagi mana-mana perkhidmatan masa nyata—sokongan pelanggan, tempahan, carian maklumat—setiap saat kesunyian menghakis kepercayaan dan mengurangkan penukaran.

Penambahbaikan teknikal yang menjimatkan satu saat

Pasukan tersebut meninggalkan saluran paip yang bersifat berturutan secara ketat dan membiarkan setiap peringkat berjalan secara selari, menyalurkan data ke peringkat seterusnya sebaik sahaja ia mempunyai data yang mencukupi.

  • Pengesanan aktiviti suara (VAD) neural. Sebuah model neural kecil memantau aliran audio dan meramalkan bila penutur selesai bercakap, mengurangkan tetingkap pengesanan daripada kira-kira 800 ms kepada 280 ms.
  • Teks-ke-suara (TTS) penstriman. Daripada menunggu jawapan teks yang lengkap, sistem menstrim frasa pertama ke penyintesis dengan serta-merta, supaya audio bermula sementara baki jawapan masih dijana.
  • Pra-pemuatan niat spekulatif. Semasa pengguna masih bercakap, model tersebut meramalkan niat yang berkemungkinan dan membuat pertanyaan ke bahagian belakang (backend) lebih awal. Jika tekaan itu betul, jawapan sedia ada sebaik sahaja ucapan tamat; jika salah, pilihan sandaran (fallback) tetap tiba dengan cepat.

Apa yang ditunjukkan oleh angka dan apa yang perlu diperhatikan seterusnya

Dengan reka bentuk bertindih ini, jumlah masa respons jatuh di bawah 1.8 saat dan kadar penukaran janji temu meningkat sebanyak 30%.

Pendekatan ini menambah kerumitan: aliran selari dan pertanyaan spekulatif menggunakan lebih banyak kuasa pengkomputeran serta memerlukan pengendalian ralat yang teliti apabila ramalan tidak tepat. Pasukan yang ingin menggunakan laluan yang sama mesti menimbang kos perkakasan berbanding jangkaan peningkatan dalam penglibatan pengguna.