넷플릭스에서 장기 회원 만족을 위한 추천 노트

넷플릭스에서 장기 회원 만족을 위한 추천

넷플릭스는 회원의 만족도를 향상시키기 위해 개인화 알고리즘을 사용하여 콘텐츠 추천을 제공합니다. 추천은 회원의 피드백과 콘텍스트를 고려하는 컨텍스트 밴딧 문제로 간주됩니다. 전통적인 추천 시스템은 클릭수와 같은 단기 지표를 최적화하는 데 초점을 맞추고 있지만, 이는 장기 만족도를 완전히 포착하지 못할 수 있습니다. 단순히 유지율을 최적화하는 것만으로는 제약이 있으므로 넷플릭스는 장기 회원 만족도와 일치하는 프록시 보상 함수를 사용합니다. 클릭률은 간단한 프록시 보상이지만 넷플릭스는 회원의 다양한 행동과 그 행동이 만족도에 미치는 영향을 고려하여 그 너머로 확장합니다. 보상 공학은 프록시 보상 함수를 장기 회원 만족도와 일치하도록 개선하는 반복적인 과정입니다. 이는 가설 형성, 보상 정의, 밴딧 정책 훈련 및 A/B 테스트를 포함합니다. 넷플릭스는 지연된 피드백의 문제를 예측하여 모든 피드백을 프록시 보상 함수에 사용할 수 있도록 해결합니다. 오프라인 모델 개선에도 불구하고 온라인-오프라인 지표 차이가 발생할 수 있습니다. 넷플릭스는 프록시 보상 정의를 추가로 개선하여 이를 해결합니다. 여전히 풀어야 할 질문들도 있습니다. 예를 들어 프록시 보상 함수 학습을 자동화하는 방법, 지연된 피드백을 기다리는 최적의 시간을 결정하는 방법, 강화 학습을 통해 장기 만족도와의 일치를 향상시키는 방법 등입니다.