보다 제어 가능한 AI 비디오 편집을 향하여: 넷플릭스에서의 초기 연구 탐색
Netflix 연구원들은 홍보용 에셋 제작 시 비디오 편집자를 지원하기 위한 두 가지 AI 도구를 개발했습니다. 첫 번째 도구인 Vera는 콘텐츠 보존 편집을 위해 설계된 계층형 비디오 확산 모델입니다. Vera는 편집을 별도의 계층으로 생성하여 원본 푸티지의 변경되지 않은 부분을 그대로 유지함으로써 신원과 세부 정보를 보존합니다. Vera를 훈련시키기 위해 특수 데이터셋을 만들고 효율적인 출력 생성을 위해 Mixture-of-Transformers 아키텍처를 사용했습니다. 평가 결과, Vera는 콘텐츠 보존 측면에서 기존 방법보다 훨씬 뛰어난 성능을 보였으며 비디오 품질도 비슷했습니다. 두 번째 도구인 VOID는 비디오 객체 및 상호 작용 삭제 프레임워크입니다. VOID는 상당한 상호 작용이 있는 객체를 제거할 때 발생하는 물리적으로 불가능한 결과의 문제를 해결합니다. 물리적으로 가능한 반사실적 비디오를 생성하는 첫 번째 패스와 아티팩트(예: 객체 변형)를 방지하기 위해 출력을 개선하는 두 번째 패스로 구성된 2단계 추론 파이프라인을 사용합니다. VOID는 시뮬레이션 및 실제 모션 캡처 데이터에서 생성된 합성 데이터를 사용하여 훈련되었습니다. 실험 결과, VOID는 이전 접근 방식에 비해 일관된 장면 역학을 더 잘 보존하는 것으로 나타났습니다. 이러한 연구 탐구는 아티스트에게 힘을 실어주면서 AI 비디오 편집을 책임감 있게 발전시키는 것을 목표로 합니다. Vera와 VOID 모두 공개된 연구 논문에 자세히 설명되어 있습니다.