构建 AI 配音流水线:faster-whisper + XTTS-v2 + FFmpeg
该项目提出了一个Python脚本,用于利用原说者的克隆声音制作英语视频的西班牙语配音。该过程从提取音频并使用更快的耳语生成带时间戳的转录开始。随后对转录文本进行机器翻译,重点是保持段落长度以避免同步问题。XTTS-v2 型号用于语音克隆和合成翻译音频,需要原始扬声器的简短参考片段。一个重大挑战是:确保合成的西班牙语音频能与原始英语时段相符,因为西班牙语通常需要更长时间的交流。这通过将溢出吸收为静音、温和的时间拉伸以及重新翻译仍然溢出的片段等技术来管理。最终,合成音频会与原始视频一起重新磁通信号,理想情况下作为额外的音轨,以便玩家控制语言选择。潜在的陷阱包括操作号码、背景音乐、多扬声器和缩略词,这些都需要仔细的预处理或专用工具。溢出报告作为关键的质量控制指标,对于更复杂的场景,建议使用预建的流水线或高级口型同步模型。