Netflixでの長期的な会員満足度向上のための推奨 ノート

Netflixでの長期的な会員満足度向上のための推奨

Netflixは、会員の長期的な満足度を高めることを目的として、パーソナライゼーションアルゴリズムを使用してコンテンツを会員に推薦します。この推薦は、会員のフィードバックに基づいてシステムがアクションを選択する文脈的なバンディット問題と捉えられます。従来のレコメンダーシステムは、クリック数などの短期的なメトリクスを最適化するが、長期的な満足度を完全に捉えることができない場合があります。長期的な会員の満足度にのみ最適化することは、問題があります。Netflixは、長期的な会員の満足度と一致するプロキシ報酬関数を使用します。クリックスルー率(CTR)は、単純なプロキシ報酬ですが、Netflixは、CTRを超える多くのユーザーアクションとそれらが満足度に与える影響を考慮します。報酬エンジニアリングは、長期的な会員の満足度と一致するプロキシ報酬関数を改良する反復的なプロセスです。このプロセスには、仮説の形成、報酬の定義、バンディットポリシーのトレーニング、A/Bテストが含まれます。Netflixは、遅延フィードバックの問題に対処するために、欠けているフィードバックを予測し、プロキシ報酬関数にすべてのフィードバックを使用します。オフラインモデル改善にもかかわらず、オンラインオフラインメトリクス不一致が、プロキシ報酬が長期的な会員の満足度と完全に一致しない場合に生じます。Netflixは、プロキシ報酬関数の定義をさらに改良することでこれを解決します。まだ解決が必要な問題として、プロキシ報酬関数の自動学習、遅延フィードバックの最適な待ち時間の決定、長期的な満足度との一致のための強化学習の活用があります。