ಒಂದು ವಾಯ್ಸ್-AI ತಂಡವು ನೈಜ ಫೋನ್ ಕರೆಗಳಲ್ಲಿ ಎಂಡ್-ಟು-ಎಂಡ್ ಪ್ರತಿಕ್ರಿಯೆಯ ವಿಳಂಬವನ್ನು (latency) 1.8 ಸೆಕೆಂಡ್ಗಿಂತ ಕಡಿಮೆ ಮಾಡಿದ್ದಾಗಿ ಘೋಷಿಸಿದೆ—ಇದು ಅದರ ಮೊದಲ ಪ್ರೊಟೊಟೈಪ್ನಿಂದ 55% ಇಳಿಕೆಯಾಗಿದೆ. ಓವರ್ಲ್ಯಾಪಿಂಗ್ ಪ್ರೊಸೆಸಿಂಗ್ ಸ್ಟ್ರೀಮ್ಗಳು, ನ್ಯೂರಲ್ ವಾಯ್ಸ್-ಆಕ್ಟಿವಿಟಿ ಡಿಟೆಕ್ಟರ್, ಸ್ಟ್ರೀಮಿಂಗ್ ಟೆಕ್ಸ್ಟ್-ಟು-ಸ್ಪೀಚ್ ಸಿಂಥೆಸಿಸ್ ಮತ್ತು ಸ್ಪೆಕ್ಯುಲೇಟಿವ್ ಇಂಟೆಂಟ್ ಪ್ರಿ-ಫೆಚಿಂಗ್ ತಂತ್ರಗಳು ಈ ಸುಧಾರಣೆಗೆ ಕಾರಣವಾಗಿದ್ದವು ಮತ್ತು ಅಪಾಯಿಂಟ್ಮೆಂಟ್ ಕನ್ವರ್ಷನ್ ದರಗಳನ್ನು ಸುಮಾರು 30% ಹೆಚ್ಚಿಸಿದವು.
ವಾಯ್ಸ್ ಅಸಿಸ್ಟೆಂಟ್ಗಳಿಗೆ ವಿಳಂಬ (latency) ಏಕೆ ಮುಖ್ಯ
ದೀರ್ಘ ವಿರಾಮಗಳು ಸಿಸ್ಟಮ್ ಇನ್ನೂ ಕೇಳಿಸಿಕೊಳ್ಳುತ್ತಿದೆಯೇ ಎಂದು ಕರೆ ಮಾಡುವವರನ್ನು ಯೋಚಿಸುವಂತೆ ಮಾಡುತ್ತವೆ. ಆರಂಭಿಕ ಪರೀಕ್ಷೆಗಳಲ್ಲಿ, ಪ್ರೊಟೊಟೈಪ್ ಪ್ರತಿಕ್ರಿಯಿಸುವ ಮೊದಲು 2.9 ಸೆಕೆಂಡುಗಳ ಕಾಲ ಕಾಯುತ್ತಿತ್ತು. ಕರೆ ಮಾಡುವವರು ಪದೇ ಪದೇ ಹೇಳುತ್ತಿದ್ದರು ಅಥವಾ ಫೋನ್ ಕಟ್ ಮಾಡುತ್ತಿದ್ದರು, ಇದು ವಿಳಂಬವು ಸಂಭಾಷಣೆಯ ಹರಿವನ್ನು (conversational flow) ಹಾಳುಮಾಡುತ್ತಿದೆ ಎಂಬುದರ ಸ್ಪಷ್ಟ ಸಂಕೇತವಾಗಿತ್ತು. ಯಾವುದೇ ರಿಯಲ್-ಟೈಮ್ ಸೇವೆಗೆ—ಕಸ್ಟಮರ್ ಸಪೋರ್ಟ್, ಬುಕಿಂಗ್, ಮಾಹಿತಿ ಹುಡುಕುವುದು—ಪ್ರತಿ ಸೆಕೆಂಡ್ ಮೌನವು ನಂಬಿಕೆಯನ್ನು ಕುಗ್ಗಿಸುತ್ತದೆ ಮತ್ತು ಕನ್ವರ್ಷನ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
ಒಂದು ಸೆಕೆಂಡ್ ಅನ್ನು ಕಡಿಮೆ ಮಾಡಿದ ತಾಂತ್ರಿಕ ಬದಲಾವಣೆಗಳು
ತಂಡವು ಕಟ್ಟುನಿಟ್ಟಾದ ಸೀಕ್ವೆನ್ಶಿಯಲ್ ಪೈಪ್ಲೈನ್ ಅನ್ನು ಬಿಟ್ಟು, ಪ್ರತಿ ಹಂತವೂ ಸಮಾಂತರವಾಗಿ (parallel) ಕಾರ್ಯನಿರ್ವಹಿಸುವಂತೆ ಮಾಡಿತು, ಮತ್ತು ಅಗತ್ಯ ಡೇಟಾ ಸಿಕ್ಕ ತಕ್ಷಣ ಮುಂದಿನ ಹಂತಕ್ಕೆ ಕಳುಹಿಸಿತು.
- ನ್ಯೂರಲ್ ವಾಯ್ಸ್-ಆಕ್ಟಿವಿಟಿ ಡಿಟೆಕ್ಷನ್ (VAD). ಒಂದು ಸಣ್ಣ ನ್ಯೂರಲ್ ಮಾಡೆಲ್ ಆಡಿಯೋ ಸ್ಟ್ರೀಮ್ ಅನ್ನು ಗಮನಿಸುತ್ತದೆ ಮತ್ತು ಮಾತನಾಡುವವರು ವಾಕ್ಯವನ್ನು ಯಾವಾಗ ಮುಗಿಸುತ್ತಾರೆ ಎಂದು ಮುನ್ಸೂಚನೆ ನೀಡುತ್ತದೆ, ಇದರಿಂದ ಡಿಟೆಕ್ಷನ್ ವಿಂಡೋವು ಸುಮಾರು 800 ms ನಿಂದ 280 ms ಗೆ ಇಳಿಕೆಯಾಯಿತು.
- ಸ್ಟ್ರೀಮಿಂಗ್ ಟೆಕ್ಸ್ಟ್-ಟು-ಸ್ಪೀಚ್ (TTS). ಪೂರ್ಣ ಪಠ್ಯದ ಉತ್ತರಕ್ಕಾಗಿ ಕಾಯುವ ಬದಲು, ಸಿಸ್ಟಮ್ ಮೊದಲ ವಾಕ್ಯವನ್ನು ತಕ್ಷಣವೇ ಸಿಂಥೆಸೈಜರ್ಗೆ ಸ್ಟ್ರೀಮ್ ಮಾಡುತ್ತದೆ, ಇದರಿಂದ ಉಳಿದ ಉತ್ತರವು ಸಿದ್ಧವಾಗುತ್ತಿರುವಾಗಲೇ ಆಡಿಯೋ ಪ್ರಾರಂಭವಾಗುತ್ತದೆ.
- ಸ್ಪೆಕ್ಯುಲೇಟಿವ್ ಇಂಟೆಂಟ್ ಪ್ರಿ-ಫೆಚಿಂಗ್. ಬಳಕೆದಾರರು ಮಾತನಾಡುತ್ತಲೇ ಇರುವಾಗ, ಮಾಡೆಲ್ ಸಂಭವನೀಯ ಉದ್ದೇಶವನ್ನು (intent) ಊಹಿಸುತ್ತದೆ ಮತ್ತು ಮುಂಚಿತವಾಗಿ ಬ್ಯಾಕೆಂಡ್ ಅನ್ನು ಪ್ರಶ್ನಿಸುತ್ತದೆ. ಒಂದು ವೇಳೆ ಊಹೆ ಸರಿಯಾಗಿದ್ದರೆ, ಬಳಕೆದಾರರು ಮಾತನಾಡುವುದನ್ನು ಮುಗಿಸಿದ ತಕ್ಷಣ ಉತ್ತರ ಸಿದ್ಧವಾಗಿರುತ್ತದೆ; ಒಂದು ವೇಳೆ ತಪ್ಪಾಗಿದ್ದರೆ, ಫಾಲ್ಬ್ಯಾಕ್ (fallback) ಕೂಡ ವೇಗವಾಗಿ ಬರುತ್ತದೆ.
ಅಂಕಿಅಂಶಗಳು ಏನು ತೋರಿಸುತ್ತವೆ ಮತ್ತು ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು
ಓವರ್ಲ್ಯಾಪಿಂಗ್ ವಿನ್ಯಾಸದೊಂದಿಗೆ, ಒಟ್ಟು ಪ್ರತಿಕ್ರಿಯೆಯ ಸಮಯವು 1.8 ಸೆಕೆಂಡ್ಗಿಂತ ಕಡಿಮೆಯಾಯಿತು ಮತ್ತು ಅಪಾಯಿಂಟ್ಮೆಂಟ್ ಕನ್ವರ್ಷನ್ ದರಗಳು 30% ಹೆಚ್ಚಿದವು.
ಈ ವಿಧಾನವು ಸಂಕೀರ್ಣತೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ: ಸಮಾಂತರ ಸ್ಟ್ರೀಮ್ಗಳು ಮತ್ತು ಸ್ಪೆಕ್ಯುಲೇಟಿವ್ ಕ್ವೇರಿಗಳು ಹೆಚ್ಚಿನ ಕಂಪ್ಯೂಟ್ ಶಕ್ತಿಯನ್ನು ಬಳಸುತ್ತವೆ ಮತ್ತು ಮುನ್ಸೂಚನೆಗಳು ತಪ್ಪಾದಾಗ ಎಚ್ಚರಿಕೆಯ ದೋಷ ನಿರ್ವಹಣೆಯನ್ನು (error handling) ಬಯಸುತ್ತವೆ. ಇದೇ ಹಾದಿಯನ್ನು ಅನುಸರಿಸಲು ಬಯಸುವ ತಂಡಗಳು, ಹಾರ್ಡ್ವೇರ್ ವೆಚ್ಚ ಮತ್ತು ಬಳಕೆದಾರರ ತೊಡಗಿಸಿಕೊಳ್ಳುವಿಕೆಯಲ್ಲಿ (user engagement) ನಿರೀಕ್ಷಿತ ಹೆಚ್ಚಳದ ನಡುವೆ ಸಮತೋಲನವನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳಬೇಕು.
