MAPS:Netflix 大规模多模态资产个性化系统” 笔记

MAPS:Netflix 大规模多模态资产个性化系统”

Netflix 旨在通过个性化的视觉资产(如海报和视频预览)将会员与其喜爱的内容连接起来。对于新上线的标题,由于缺乏足够的交互数据,难以实现有效的个性化,这一问题被称为“冷启动”问题。传统上,模型将资产视为不透明的 ID,依赖流行度启发式方法,直到积累足够的数据。这意味着新内容的个性化被推迟,影响了内容发现体验。Netflix 的解决方案是利用多模态嵌入,使模型能够“看见”和“听见”这些资产。通过使用 CLIP(一种预训练的图片 - 文本模型)对海报进行编码,资产获得了视觉理解能力。该 CLIP 嵌入与资产的 ID 嵌入拼接,形成更丰富的表示,能够捕捉视觉主题和人才信息。这使得即使在没有交互历史之前,也能根据会员对视觉风格的偏好进行个性化,并促进不同标题之间的知识迁移。该方法还实现了模型整合,将针对不同海报画布的独立模型合并为单一统一模型。由于 CLIP 嵌入对裁剪和缩放具有高度不变性,近乎相同的海报渲染会映射到相似的向量。这种跨画布的交互信号聚合,尤其有利于低数据画布,使得单一模型能够为所有海报放置位置实现个性化。为解决不同画布间的数据不平衡问题,采用基于奖励的加权策略,依据交互的长期价值而非展示量进行优先级排序。该方法的成效通过离线评估(使用逆倾向得分)和大规模 A/B 测试得到验证。将图像嵌入与统一模型(V3)相结合,显著优于仅包含其中一项改进的模型。这种组合方法在 Netflix 主页重大改版期间发挥了关键作用,当时引入了一个历史数据极少的优势画布。带有 CLIP 嵌入的统一模型成功为该新布局实现了内容个性化,在发现指标和流媒体时长上均显示出具有统计显著性的提升,凸显了多模态嵌入在克服冷启动问题方面的强大能力。