Netflix TechBlog | Medium на русском
Подписаться
Оценка синопсисов шоу Netflix с LLM-а-судьей
Netflix стремится улучшить процесс выбора краткого содержания для своей огромной библиотеки контента.
Тысячи названий усложняют выбор пользователя, делая краткие содержания важными для принятия решений.
Высококачественные краткие содержания повышают вовлеченность пользователей, а плохие приводят к разочарованию и отказу.
Проблема заключается в масштабировании проверки качества на сотни тысяч кратких содержаний.
Netflix разработала подход на основе модели крупномасштабного языка (LLM) для оценки качества кратких содержаний по четырем ключевым направлениям.
Эта система достигает более 85% согласия с творческими писателями, обеспечивая стандарты качества, основанные на мнении экспертов.
Качество краткого содержания оценивается как через творческую ценность, определяемую писателями, так и через неявную обратную связь пользователей посредством метрик потокового вещания.
Система LLM-as-a-Judge использует методы, такие как многоуровневые обоснования, оценка консенсуса и агенты фактичности, для оптимизации точности.
Эти баллы качества, полученные из LLM, коррелируют с ключевыми метриками потокового вещания, такими как доля просмотра и коэффициент отказа.
Это позволяет Netflix проактивно выявлять и исправлять проблемы с краткими содержаниями, улучшая опыт пользователя и открытие контента.