呼叫方在听到两秒的沉默后,代理才开口说话。 笔记

呼叫方在听到两秒的沉默后,代理才开口说话。

语音代理存在一个严重缺陷:由于音频播放存在两秒延迟,来电者会在问候语播放期间抢话。该延迟源于系统需等待整个大语言模型(LLM)响应生成完毕后才将其发送至文本转语音(TTS)引擎。初步调查对音频管道的各个阶段进行了计时分析,包括语音转文本、LLM 处理、文本转语音及网络传输。分析结果显示,LLM 完成生成和 TTS 冷启动是造成过高延迟的主要原因。为修复此问题,将 LLM 的输出逐句流式传输至 TTS 引擎,使音频生成能够更早开始。此外,对 TTS 连接进行预热并保持长连接,以降低其启动时间。一项关键改进是在来电者说完话后立即发送一段预先合成的简短确认音。这种即时音频反馈掩盖了剩余的处理时间,避免了“死空气”的感知。这些优化将首次音频输出时间从两秒缩短至约 150 毫秒(针对确认音)。核心经验在于将延迟视为跨阶段的预算,并优先提供即时音频反馈,而非等待完整且完美的响应。流式传输 LLM 输出并提供即时确认的策略解决了抢话问题,并提升了用户体验。