발신자는 상담원이 말하기 전 2초간 침묵을 들었습니다.
음성 에이전트에서 오디오 재생 지연 2초로 인해 발신자가 인사말을 가로채는 치명적인 버그가 발생했습니다. 이 지연은 시스템이 전체 LLM 응답이 생성될 때까지 기다렸다가 텍스트 음성 변환으로 보내기 때문에 발생했습니다. 초기 조사에는 음성-텍스트, LLM 처리, 텍스트 음성 변환, 네트워크 전송 등 오디오 파이프라인의 각 단계 시간을 측정하는 것이 포함되었습니다. 분석 결과 LLM 완료 및 TTS 콜드 스타트가 과도한 지연 시간의 주요 원인으로 밝혀졌습니다.이를 해결하기 위해 LLM의 출력을 문장 단위로 TTS 엔진으로 스트리밍하여 오디오 생성을 훨씬 일찍 시작할 수 있도록 했습니다. 또한 TTS 연결을 미리 워밍업하고 열어두어 시작 시간을 줄였습니다. 중요한 개선 사항은 발신자가 말을 마친 직후 짧고 미리 합성된 확인 응답을 보내는 것이었습니다. 이 즉각적인 오디오 피드백은 나머지 처리 시간을 숨겨 무음 상태를 방지했습니다. 이러한 최적화를 통해 첫 오디오까지의 시간이 2초에서 확인 응답의 경우 약 150밀리초로 줄었습니다. 핵심은 지연 시간을 각 단계에 걸쳐 예산으로 취급하고 완전하고 완벽한 응답을 기다리는 것보다 즉각적인 오디오 피드백을 우선시하는 것이었습니다. LLM 출력을 스트리밍하고 즉각적인 확인 응답을 제공하는 전략은 충돌 문제를 해결하고 사용자 경험을 개선했습니다.