発信者は、オペレーターが話し始めるまで2秒間無音を聞いた。 ノート

発信者は、オペレーターが話し始めるまで2秒間無音を聞いた。

ボイスエージェントにおいて、オーディオ再生の2秒遅延により、発信者が挨拶の途中で話してしまうという重大なバグが発生していました。この遅延は、システムがLLMの応答全体が生成されるのを待ってからテキスト読み上げに送信していたために発生していました。初期調査では、オーディオパイプラインの各段階(音声認識、LLM処理、テキスト読み上げ、ネットワーク送信)のタイミングを測定しました。分析の結果、LLMの完了とTTSのコールドスタートが過剰な遅延の主な原因であることが明らかになりました。これを修正するために、LLMの出力を文ごとにTTSエンジンにストリーミングし、オーディオ生成をより早く開始できるようにしました。さらに、TTS接続を事前にウォームアップし、開いたままにして起動時間を短縮しました。重要な改善点として、発信者が話し終えた直後に、短く事前に合成された確認音を送信しました。この即時のオーディオフィードバックにより、残りの処理時間がマスクされ、無音状態の認識が防止されました。これらの最適化により、最初のオーディオまでの時間が2秒から、確認音については約150ミリ秒に短縮されました。重要な教訓は、遅延を各段階の予算として扱い、完全で完璧な応答を待つよりも、即時のオーディオフィードバックを優先することでした。LLM出力をストリーミングし、即時の確認音を提供する戦略により、衝突の問題が解決され、ユーザーエクスペリエンスが向上しました。