Recommander pour la satisfaction à long terme des membres chez Netflix
Netflix emploie des algorithmes de personnalisation pour recommander du contenu à ses membres, dans le but d'améliorer la satisfaction à long terme. Les recommandations sont considérées comme un problème de bandit contextuel, où le système sélectionne des actions en fonction du contexte et des retours des membres. Les systèmes de recommandation traditionnels optimisent pour des métriques à court terme comme les clics, qui ne capturent peut-être pas entièrement la satisfaction à long terme. L'optimisation pour la rétention seule présente des inconvénients, donc Netflix utilise des fonctions de récompense proxy alignées sur la satisfaction à long terme des membres. Le taux de clic (CTR) est une récompense proxy simple, mais Netflix va au-delà du CTR pour considérer diverses actions utilisateur et leurs implications sur la satisfaction. L'ingénierie de récompense est un processus itératif de raffinement de la fonction de récompense proxy pour aligner avec la satisfaction à long terme des membres, impliquant la formation d'hypothèses, la définition de récompense, la formation de politique de bandit et les tests A/B. Netflix répond au défi du feedback retardé en prédissant le feedback manquant, permettant l'utilisation de tout le feedback dans la fonction de récompense proxy. Malgré les améliorations offline du modèle, une disparité entre les métriques en ligne et hors ligne peut survenir lorsque la récompense proxy n'est pas entièrement alignée sur la satisfaction à long terme. Netflix résout cela en raffinant encore la définition de la récompense proxy. Des questions ouvertes persistent, telles que l'apprentissage automatique de la fonction de récompense proxy, la détermination du temps d'attente optimal pour le feedback retardé et l'utilisation de l'apprentissage par renforcement pour aligner avec la satisfaction à long terme.