DEV Community 日本語
フォロー
AIダビングパイプラインを構築する:faster-whisper + XTTS-v2 + FFmpeg
このプロジェクトは、元の話者のクローン音声を使って英語動画のスペイン語吹き替えを作成するためのPythonスクリプトを概説します。このプロセスは、音声を抽出し、タイムスタンプ付きの文字起こしを高速ささやきで生成することから始まります。その後、文字起こしに機械翻訳が適用され、同期問題を避けるためにセグメントの長さの維持に重点を置きます。XTTS-v2モデルは音声クローン作成や翻訳音声の合成に使用され、元のスピーカーの短い参照クリップが必要です。重要な課題として、合成されたスペイン語音声が元の英語の時間枠に収まるようにすることが課題です。なぜなら、スペイン語は話すのに時間がかかることが多いからです。これは、オーバーフローを静寂に吸収したり、穏やかなタイムストレッチをしたり、まだオーバーフローしているセグメントの再翻訳などの技術で管理されています。最終的に、合成音声は元の映像とリマックスされ、理想的にはプレイヤーが言語選択を制御できる追加の音声トラックとして機能します。潜在的な落とし穴には、数字の処理、背景音楽、複数のスピーカー、頭字語などがあり、これらはすべて慎重な事前処理や専門的なツールを必要とします。オーバーフローレポートは重要な品質管理指標として機能し、より複雑なシナリオでは、既製品パイプラインや高度なリップシンクモデルが推奨されます。