为 Pinterest 首页信息流扩展条件化学习检索 笔记

为 Pinterest 首页信息流扩展条件化学习检索

Pinterest 的主页信息流旨在通过改进推荐系统,为用户检索相关的 Pins。最初采用双塔模型,分别对用户和物品进行编码,但难以应对用户的多重兴趣。为此,提出了条件化学习检索(Conditional Learned Retrieval, CLR),通过显式检索上下文对用户嵌入进行条件化以解决该问题。 prior 工作已探索将 CLR 用于通知的引导式训练,并将其集成到主页信息流的多嵌入框架中。本文详细介绍了 CLR 如何演变为 Pinterest 主页信息流的更广泛检索系统。CLR 通过引入兴趣(Interests)、Pins 和 Boards 等新条件类型,扩展以支持多样化的检索候选项。兴趣条件最初从用户信号中引导式训练,随后利用大语言模型(LLM)生成的兴趣进行增强。Pin 条件通过对已互动的 Pins 进行聚类,并使用嵌入表示,使 CLR 能够替代遗留的生成器。Board 条件则通过在 Pin-Board 图上执行随机游走构建,并使用嵌入表示 Boards。模型基础通过序列建模和增强的条件表示进行了扩展。引入了条件化用户序列 Transformer(Conditioned User Sequence Transformer),使 CLR 具备序列感知能力,通过同时编码用户行为和条件 token 来实现。该架构进一步演化为基于基础模型(Foundation Model)的 CLR 架构,整合了在大规模全局用户序列上训练的大型 Transformer。该基础模型对用户塔和物品塔共享 Pin 嵌入,并采用对比对齐损失(contrastive alignment loss)。条件表示被统一,以便在单个模型内处理异构条件,减少重复工作。统一 CLR 将不同条件类型整合到一个模型中,支持多种条件输入并补全缺失特征。路由简化涉及将路由逻辑重构为与条件无关的槽位架构(Slot Architecture),为不同类型的嵌入预定义槽位。CLR 的训练效率通过无损的基础设施优化得到提升,训练吞吐量翻倍。请求级训练(request-level training)在批次内去重相同的用户特征,进一步优化工作正在进行中。该系统现已能在生产规模下高效处理多条件检索,通过提供更多样且相关的内容提升用户参与度。
CdXz5zHNQW_6wtn6E8XMD.png