LLM을 심사위원으로 활용한 넷플릭스 쇼 시놉시 평가
넷플릭스는 방대한 콘텐츠 라이브러리의 시놉시스 선정 프로세스를 개선하고자 합니다.수천 개의 타이틀은 사용자의 선택을 복잡하게 만들며, 시놉시스는 의사 결정에 중요한 역할을 합니다.고품질 시놉시스는 사용자 참여를 높이는 반면, 저품질 시놉시스는 좌절감과 이탈로 이어집니다.과제는 수십만 개의 시놉시스에 걸쳐 품질 검증을 확장하는 데 있습니다.넷플릭스는 네 가지 핵심 차원에서 시놉시스 품질을 평가하기 위해 LLM 기반 접근 방식을 개발했습니다.이 시스템은 창작 작가들과 85% 이상의 일치율을 달성하여 전문가 주도의 품질 표준을 보장합니다.시놉시스 품질은 작가들이 정의한 창의적 품질과 스트리밍 지표를 통한 회원들의 암묵적 피드백을 통해 평가됩니다.LLM-as-a-Judge 시스템은 정확도를 최적화하기 위해 계층적 근거, 합의 점수, 사실성 에이전트와 같은 기술을 사용합니다.이러한 LLM에서 파생된 품질 점수는 취득률 및 이탈률과 같은 주요 스트리밍 지표와 상관 관계가 있습니다.이를 통해 넷플릭스는 시놉시스 문제를 사전에 파악하고 수정하여 회원 경험과 콘텐츠 검색을 개선할 수 있습니다.