한 음성 AI 팀이 실제 전화 통화에서의 종단 간(end-to-end) 응답 지연 시간을 첫 번째 프로토타입 대비 55% 단축된 1.8초 미만으로 줄였다고 발표했습니다. 중첩된 처리 스트림, 신경망 음성 활동 감지기, 스트리밍 텍스트 음성 변환(TTS) 합성, 그리고 추측적 의도 사전 가져오기(speculative intent pre-fetching) 기술이 이러한 성과를 이끌어냈으며, 예약 전환율 또한 약 30% 향상되었습니다.
음성 비서에게 지연 시간이 중요한 이유
긴 침묵은 발신자로 하여금 시스템이 여전히 듣고 있는지 의구심을 갖게 만듭니다. 초기 테스트에서 프로토타입은 응답하기까지 2.9초를 기다려야 했습니다. 발신자들은 말을 반복하거나 전화를 끊어버렸는데, 이는 지연 시간이 대화의 흐름을 끊고 있다는 명확한 신호였습니다. 고객 지원, 예약, 정보 조회와 같은 모든 실시간 서비스에서 단 1초의 침묵도 신뢰를 떨어뜨리고 전환율을 낮춥니다.
1초를 단축한 기술적 개선 사항
팀은 엄격한 순차적 파이프라인 방식을 버리고 각 단계를 병렬로 실행하여, 충분한 데이터가 확보되는 즉시 다음 단계로 전달하도록 했습니다.
- 신경망 음성 활동 감지(VAD). 소형 신경망 모델이 오디오 스트림을 모니터링하여 화자가 문장을 마치는 시점을 예측함으로써, 감지 시간을 약 800ms에서 280ms로 단축했습니다.
- 스트리밍 텍스트 음성 변환(TTS). 전체 텍스트 답변이 완성될 때까지 기다리는 대신, 시스템이 첫 구절을 즉시 합성기에 스트리밍하여 나머지 답변이 생성되는 동안 오디오가 시작되도록 합니다.
- 추측적 의도 사전 가져오기(Speculative intent pre-fetching). 사용자가 말을 하는 동안 모델이 예상되는 의도를 예측하고 백엔드에 미리 쿼리를 보냅니다. 예측이 맞으면 발화가 끝나는 즉시 답변이 준비되며, 예측이 틀리더라도 대체(fallback) 답변이 빠르게 전달됩니다.
수치가 보여주는 결과와 향후 주목할 점
중첩 설계(overlapping design)를 통해 총 응답 시간은 1.8초 미만으로 떨어졌고, 예약 전환율은 30% 상승했습니다.
이러한 접근 방식은 복잡성을 증가시킵니다. 병렬 스트림과 추측적 쿼리는 더 많은 연산 자원을 소비하며, 예측이 빗나갔을 때 세심한 오류 처리가 필요합니다. 동일한 경로를 고려하는 팀은 하드웨어 비용과 예상되는 사용자 참여도 상승 사이의 균형을 잘 따져보아야 합니다.
