HeyGen x Google Cloud: アバターIVをTPUに導入
HeyGen は、torchax および XLA を介して、8 チップメッシュ全体で FSDP および Ulysses シーケンス並列処理を利用し、18B+ パラメータの Avatar IV ビデオ生成モデルを Google Cloud の Trillium (v6e) TPU にポートしました。リアルタイムストリーミングの速度を 1.86 倍向上させるために、エンジニアリングチームは、すべての all-to-all コレクティブをパイプライン化して公開し、マスクパディングを排除するためにスパースアテンションブロックサイズを調整し、事前計算されたコーシー・シュワルツの上限を使用して softmax のシリアル依存関係を回避しました。これらのカスタム Pallas カーネルおよびコンパイラ最適化は、バイト同一または数学的に同等のピクセル出力を保証するために、厳格な 2 段階の品質ゲートを通過した後でのみ展開されました。