ਇੱਕ ਵੌਇਸ-AI ਟੀਮ ਨੇ ਐਲਾਨ ਕੀਤਾ ਹੈ ਕਿ ਉਨ੍ਹਾਂ ਨੇ ਅਸਲ ਫ਼ੋਨ ਕਾਲਾਂ 'ਤੇ ਐਂਡ-ਟੂ-ਐਂਡ ਰਿਸਪਾਂਸ ਲੇਟੈਂਸੀ (latency) ਨੂੰ 1.8 ਸੈਕਿੰਡ ਤੋਂ ਘੱਟ ਕਰ ਦਿੱਤਾ ਹੈ—ਜੋ ਕਿ ਉਨ੍ਹਾਂ ਦੇ ਪਹਿਲੇ ਪ੍ਰੋਟੋਟਾਈਪ ਤੋਂ 55% ਦੀ ਗਿਰਾਵਟ ਹੈ। ਓਵਰਲੈਪਿੰਗ ਪ੍ਰੋਸੈਸਿੰਗ ਸਟ੍ਰੀਮਜ਼, ਇੱਕ ਨਿਊਰਲ ਵੌਇਸ-ਐਕਟੀਵਿਟੀ ਡਿਟੈਕਟਰ, ਸਟ੍ਰੀਮਿੰਗ ਟੈਕਸਟ-ਟੂ-ਸਪੀਚ ਸਿੰਥੇਸਿਸ, ਅਤੇ ਸਪੈਕੂਲੇਟਿਵ ਇੰਟੈਂਟ ਪ੍ਰੀ-ਫੈਚਿੰਗ ਨੇ ਇਸ ਸੁਧਾਰ ਨੂੰ ਸੰਭਵ ਬਣਾਇਆ ਅਤੇ ਅਪੌਇੰਟਮੈਂਟ ਕਨਵਰਜ਼ਨ ਰੇਟ ਨੂੰ ਲਗਭਗ 30% ਵਧਾ ਦਿੱਤਾ।
ਵੌਇਸ ਅਸਿਸਟੈਂਟਸ ਲਈ ਲੇਟੈਂਸੀ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਲੰਬੇ ਵਿਰਾਮ ਕਾਲ ਕਰਨ ਵਾਲਿਆਂ ਨੂੰ ਇਹ ਸੋਚਣ ਲਈ ਮਜਬੂਰ ਕਰਦੇ ਹਨ ਕਿ ਕੀ ਸਿਸਟਮ ਅਜੇ ਵੀ ਸੁਣ ਰਿਹਾ ਹੈ। ਸ਼ੁਰੂਆਤੀ ਟੈਸਟਾਂ ਵਿੱਚ, ਪ੍ਰੋਟੋਟਾਈਪ ਜਵਾਬ ਦੇਣ ਤੋਂ ਪਹਿਲਾਂ 2.9 ਸੈਕਿੰਡ ਤੱਕ ਉਡੀਕ ਕਰਦਾ ਸੀ। ਕਾਲ ਕਰਨ ਵਾਲੇ ਆਪਣੀ ਗੱਲ ਦੁਹਰਾਉਂਦੇ ਸਨ ਜਾਂ ਫ਼ੋਨ ਕੱਟ ਦਿੰਦੇ ਸਨ, ਜੋ ਕਿ ਇਸ ਗੱਲ ਦਾ ਸਪੱਸ਼ਟ ਸੰਕੇਤ ਸੀ ਕਿ ਲੈਗ (lag) ਕਾਰਨ ਗੱਲਬਾਤ ਦਾ ਵਹਾਅ ਟੁੱਟ ਰਿਹਾ ਸੀ। ਕਿਸੇ ਵੀ ਰੀਅਲ-ਟਾਈਮ ਸੇਵਾ ਲਈ—ਗਾਹਕ ਸਹਾਇਤਾ (customer support), ਬੁਕਿੰਗ, ਜਾਣਕਾਰੀ ਲੱਭਣਾ—ਚੁੱਪ ਦਾ ਹਰ ਇੱਕ ਸੈਕਿੰਡ ਭਰੋਸਾ ਘਟਾਉਂਦਾ ਹੈ ਅਤੇ ਕਨਵਰਜ਼ਨ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ।
ਉਹ ਤਕਨੀਕੀ ਸੁਧਾਰ ਜਿਨ੍ਹਾਂ ਨੇ ਇੱਕ ਸੈਕਿੰਡ ਘਟਾ ਦਿੱਤਾ
ਟੀਮ ਨੇ ਸਖ਼ਤ ਤੌਰ 'ਤੇ ਕ੍ਰਮਵਾਰ (sequential) ਪਾਈਪਲਾਈਨ ਨੂੰ ਛੱਡ ਦਿੱਤਾ ਅਤੇ ਹਰੇਕ ਪੜਾਅ ਨੂੰ ਪੈਰਲਲ (parallel) ਚਲਾਉਣ ਦਿੱਤਾ, ਜਿਵੇਂ ਹੀ ਲੋੜੀਂਦਾ ਡੇਟਾ ਮਿਲਦਾ ਸੀ, ਅਗਲੇ ਪੜਾਅ ਨੂੰ ਫੀਡ ਕਰ ਦਿੱਤਾ ਜਾਂਦਾ ਸੀ।
- ਨਿਊਰਲ ਵੌਇਸ-ਐਕਟੀਵਿਟੀ ਡਿਟੈਕਸ਼ਨ (VAD)। ਇੱਕ ਛੋਟਾ ਨਿਊਰਲ ਮਾਡਲ ਆਡੀਓ ਸਟ੍ਰੀਮ 'ਤੇ ਨਜ਼ਰ ਰੱਖਦਾ ਹੈ ਅਤੇ ਅਨੁਮਾਨ ਲਗਾਉਂਦਾ ਹੈ ਕਿ ਬੁਲਤਾ (speaker) ਕਦੋਂ ਵਾਕ ਖਤਮ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਡਿਟੈਕਸ਼ਨ ਵਿੰਡੋ ਲਗਭਗ 800 ms ਤੋਂ ਘਟਾ ਕੇ 280 ms ਹੋ ਗਈ ਹੈ।
- ਸਟ੍ਰੀਮਿੰਗ ਟੈਕਸਟ-ਟੂ-ਸਪੀਚ (TTS)। ਪੂਰੇ ਟੈਕਸਟ ਵਾਲੇ ਜਵਾਬ ਦੀ ਉਡੀਕ ਕਰਨ ਦੀ ਬਜਾਏ, ਸਿਸਟਮ ਤੁਰੰਤ ਪਹਿਲੇ ਵਾਕ ਨੂੰ ਸਿੰਥੇਸਾਈਜ਼ਰ ਨੂੰ ਸਟ੍ਰੀਮ ਕਰ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਜੋ ਜਵਾਬ ਦਾ ਬਾਕੀ ਹਿੱਸਾ ਤਿਆਰ ਹੋ ਰਿਹਾ ਹੋਵੇ ਤਾਂ ਹੀ ਆਡੀਓ ਸ਼ੁਰੂ ਹੋ ਜਾਵੇ।
- ਸਪੈਕੂਲੇਟਿਵ ਇੰਟੈਂਟ ਪ੍ਰੀ-ਫੈਚਿੰਗ। ਜਦੋਂ ਉਪਭੋਗਤਾ ਅਜੇ ਵੀ ਗੱਲ ਕਰ ਰਿਹਾ ਹੁੰਦਾ ਹੈ, ਮਾਡਲ ਸੰਭਾਵਿਤ ਇੰਟੈਂਟ ਦਾ ਅਨੁਮਾਨ ਲਗਾਉਂਦਾ ਹੈ ਅਤੇ ਪਹਿਲਾਂ ਹੀ ਬੈਕਐਂਡ ਨੂੰ ਕੁਐਰੀ ਕਰਦਾ ਹੈ। ਜੇਕਰ ਅੰਦਾਜ਼ਾ ਸਹੀ ਨਿਕਲਦਾ ਹੈ, ਤਾਂ ਬੋਲਣ ਦੇ ਸਮੇਂ ਖਤਮ ਹੁੰਦੇ ਹੀ ਜਵਾਬ ਤਿਆਰ ਹੁੰਦਾ ਹੈ; ਜੇਕਰ ਇਹ ਗਲਤ ਹੈ, ਤਾਂ ਫਾਲਬੈਕ (fallback) ਫਿਰ ਵੀ ਤੇਜ਼ੀ ਨਾਲ ਆ ਜਾਂਦਾ ਹੈ।
ਅੰਕੜੇ ਕੀ ਦਰਸਾਉਂਦੇ ਹਨ ਅਤੇ ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
ਓਵਰਲੈਪਿੰਗ ਡਿਜ਼ਾਈਨ ਦੇ ਨਾਲ, ਕੁੱਲ ਰਿਸਪਾਂਸ ਸਮਾਂ 1.8 ਸੈਕਿੰਡ ਤੋਂ ਘੱਟ ਹੋ ਗਿਆ ਅਤੇ ਅਪੌਇੰਟਮੈਂਟ ਕਨਵਰਜ਼ਨ ਰੇਟ 30% ਵਧ ਗਿਆ।
ਇਹ ਪਹੁੰਚ ਗੁੰਝਲਦਾਰਤਾ ਵਧਾਉਂਦੀ ਹੈ: ਪੈਰਲਲ ਸਟ੍ਰੀਮਜ਼ ਅਤੇ ਸਪੈਕੂਲੇਟਿਵ ਕੁਐਰੀਜ਼ ਵਧੇਰੇ ਕੰਪਿਊਟ (compute) ਦੀ ਵਰਤੋਂ ਕਰਦੀਆਂ ਹਨ ਅਤੇ ਜਦੋਂ ਅਨੁਮਾਨ ਗਲਤ ਹੁੰਦੇ ਹਨ ਤਾਂ ਸਾਵਧਾਨੀ ਨਾਲ ਗਲਤੀਆਂ ਨੂੰ ਸੰਭਾਲਣ (error handling) ਦੀ ਮੰਗ ਕਰਦੀਆਂ ਹਨ। ਇਸੇ ਰਸਤੇ 'ਤੇ ਚੱਲਣ ਦੀ ਯੋਜਨਾ ਬਣਾਉਣ ਵਾਲੀਆਂ ਟੀਮਾਂ ਨੂੰ ਉਮੀਦ ਕੀਤੇ ਯੂਜ਼ਰ ਇੰਗੇਜਮੈਂਟ ਵਾਧੇ ਦੇ ਬਦਲੇ ਹਾਰਡਵੇਅਰ ਦੀ ਲਾਗਤ ਨੂੰ ਤੋਲਣਾ ਚਾਹੀਦਾ ਹੈ।
