HeyGen x Google Cloud: 아바타 IV를 TPU로 가져오기
HeyGen은 torchax와 XLA를 통해 18B 이상의 파라미터를 가진 Avatar IV 비디오 생성 모델을 Google Cloud의 Trillium (v6e) TPU로 포팅했으며, 8개 칩 메쉬에 걸쳐 FSDP와 Ulysses 시퀀스 병렬 처리를 활용했습니다. 실시간 스트리밍을 위한 1.86배의 속도 향상을 달성하기 위해 엔지니어링 팀은 노출된 모든-투-모든 콜렉티브를 파이프라인화하고, 마스크 패딩을 제거하기 위해 희소 어텐션 블록 크기를 정렬했으며, 사전 계산된 코시-슈바르츠 상한을 사용하여 소프트맥스 직렬 종속성을 우회했습니다. 이러한 맞춤형 Pallas 커널 및 컴파일러 최적화는 바이트 동일하거나 수학적으로 동등한 픽셀 출력을 보장하기 위한 엄격한 2단계 품질 게이트를 통과한 후에만 배포되었습니다.