迈向更可控的 AI 视频编辑:Netflix 的早期研究探索 笔记

迈向更可控的 AI 视频编辑:Netflix 的早期研究探索

Netflix 研究人员开发了两款人工智能工具,以协助视频编辑人员制作宣传素材。第一款工具名为 Vera,是一种用于内容保留编辑的分层视频扩散模型。Vera 将编辑结果生成为独立图层,使原始素材中未修改的部分保持原样,从而保留人物身份与细节。为训练 Vera,研究团队构建了一个专用数据集,并采用混合 Transformer(Mixture-of-Transformers)架构以实现高效的输出生成。评估结果显示,Vera 在内容保留方面显著优于现有方法,同时视频质量相当。第二款工具名为 VOID,是一个视频对象及交互删除框架。VOID 解决了在移除具有显著交互作用的物体时可能产生物理上不合理的结果这一挑战。它采用两阶段推理流程:第一阶段生成物理上合理的反事实视频;第二阶段对输出进行细化,以防止物体形变等伪影。VOID 使用基于仿真生成的合成数据以及真实世界动作捕捉数据进行训练。实验表明,与以往方法相比,VOID 能更好地保持场景动态的一致性。这些研究探索旨在负责任地推进 AI 视频编辑技术,同时赋能创作者。Vera 和 VOID 的详细信息均发表于公开的研究论文中。
CdXz5zHNQW_YZ3adN1Eip.gif