ஒரு குரல்-AI குழு, நிஜமான தொலைபேசி அழைப்புகளில் முழுமையான பதில் லேட்டன்சியை (end-to-end response latency) 1.8 வினாடிகளுக்கும் குறைவாகக் குறைத்துள்ளதாக அறிவித்துள்ளது—இது அதன் முதல் முன்மாதிரியை விட 55% குறைவுவாகும். ஒன்றையொன்று மேலோver செய்யும் செயலாக்க ஓட்டங்கள் (overlapping processing streams), ஒரு நியூரல் குரல்-செயல்பாட்டு கண்டறிவி (neural voice-activity detector), ஸ்ட்ரீமிங் உரையிலிருந்து பேச்சு உருவாக்கம் (streaming text-to-speech synthesis) மற்றும் ஊகிக்கப்பட்ட நோக்கத்தை முன்கூட்டியே பெறுதல் (speculative intent pre-fetching) ஆகியவை இந்த முன்னேற்றத்திற்கு வழிவகுத்தன மற்றும் முன்பதிவு மாற்ற விகிதங்களை (appointment conversion rates) தோராயமாக 30% உயர்த்தின.

குரல் உதவியாளர்களுக்கு லேட்டன்சி ஏன் முக்கியமானது

நீண்ட இடைவெளிகள், கணினி இன்னும் கேட்டுக்கொண்டிருக்கிறதா என்று அழைப்பவர்களைக் குழப்பமடையச் செய்கின்றன. ஆரம்பக்கட்ட சோதனைகளில், முன்மாதிரி பதிலளிப்பதற்கு முன் 2.9 வினாடிகள் காத்திருந்தது. அழைப்பவர்கள் மீண்டும் மீண்டும் பேசினார்கள் அல்லது அழைப்பைத் துண்டித்தனர், இது உரையாடல் ஓட்டம் (conversational flow) தடைபடுவதற்கான தெளிவான அறிகுறியாகும். வாடிக்கையாளர் சேவை, முன்பதிவு, தகவல் தேடல் போன்ற எந்தவொரு நிகழ்நேர சேவைக்கும் (real-time service), ஒவ்வொரு வினாடி மௌனமும் நம்பிக்கையைச் சிதைத்து, மாற்ற விகிதங்களைக் குறைக்கிறது.

ஒரு வினாடியைக் குறைத்த தொழில்நுட்ப மாற்றங்கள்

இந்தக் குழு, கடுமையான வரிசைமுறை வழிமுறையை (strictly sequential pipeline) கைவிட்டு, ஒவ்வொரு நிலையையும் இணைவாக (in parallel) இயங்கச் செய்தது; ஒரு நிலையானது போதுமான தரவைப் பெற்றவுடன் அடுத்த நிலைக்குத் தடையின்றி வழங்கியது.

  • நியூரல் குரல்-செயல்பாட்டு கண்டறிதல் (VAD). ஒரு சிறிய நியூரல் மாடல் ஆடியோ ஓட்டத்தைக் கவனித்து, பேசுபவர் ஒரு வாக்கியத்தை எப்போது முடிக்கிறார் என்பதைக் கணிக்கிறது; இது கண்டறியும் கால அளவை சுமார் 800 ms-லிருந்து 280 ms ஆகக் குறைக்கிறது.
  • ஸ்ட்ரீமிங் உரையிலிருந்து பேச்சு (TTS). முழுமையான உரை பதிலுக்காகக் காத்திருக்காமல், இந்த அமைப்பு முதல் சொற்றொடரை உடனடியாகத் தொகுப்பிற்கு (synthesizer) அனுப்புகிறது, இதனால் பதிலின் மீதமுள்ள பகுதி உருவாக்கப்படும் போதே ஆடியோ தொடங்குகிறது.
  • ஊகிக்கப்பட்ட நோக்கத்தை முன்கூட்டியே பெறுதல் (Speculative intent pre-fetching). பயனர் பேசிக்கொண்டிருக்கும்போதே, மாடல் அவர் சொல்ல வரும் நோக்கத்தை ஊகித்து, முன்கூட்டியே பேக்எண்டில் (backend) வினவல்களைச் செய்கிறது. ஊகம் சரியாக இருந்தால், பயனர் பேச்சை முடித்த அடுத்த கணமே பதில் தயாராக இருக்கும்; ஊகம் தவறாக இருந்தால் கூட, மாற்றுப் பதில் (fallback) விரைவாக வந்துவிடும்.

புள்ளிவிவரங்கள் எதைக் காட்டுகின்றன மற்றும் அடுத்து கவனிக்க வேண்டியவை

இந்த இணைந்த வடிவமைப்பால் (overlapping design), மொத்தப் பதில் நேரம் 1.8 வினாடிகளுக்கும் குறைவாகக் குறைந்ததுடன், முன்பதிவு மாற்ற விகிதங்கள் 30% அதிகரித்துள்ளன.

இந்த அணுகுமுறை சிக்கல்களைச் சேர்க்கிறது: இணை ஓட்டங்கள் (parallel streams) மற்றும் ஊகிக்கப்பட்ட வினவல்கள் (speculative queries) அதிக கணினித் திறனை (compute) பயன்படுத்துகின்றன மற்றும் கணிப்புகள் தவறாகும் போது கவனமான பிழை கையாளுதலை (error handling) கோருகின்றன. இதே பாதையைத் தேர்ந்தெடுக்க விரும்பும் குழுக்கள், வன்பொருள் செலவிற்கும் (hardware cost) எதிர்பார்க்கப்படும் பயனர் ஈடுபாட்டின் (user engagement) அதிகரிப்பிற்கும் இடையிலான சமநிலையைத் தீர்மானிக்க வேண்டும்.