시계 대신 콘텐츠로 비디오 프레임 선택하기
Video Timeline (VTL)는 단순한 스크린샷 샘플링에 비해 언어 모델이 비디오 콘텐츠를 분석하는 데 더 통찰력 있는 접근 방식을 제공합니다. 기존 방법은 고정된 간격으로 프레임을 캡처하므로 종종 프레임 사이의 간격에 있는 중요한 정보를 놓칩니다. 그러나 VTL은 비디오 내의 시각적 변화를 기반으로 프레임을 지능적으로 샘플링합니다. 이 방법은 중요한 장면 변화를 놓치지 않고 정적 콘텐츠의 중복 프레임을 최소화합니다.벤치마크에서 VTL은 동일한 프레임 예산으로 비디오 콘텐츠를 캡처하는 데 상당한 개선을 보여줍니다. 균일 샘플링이 최대 3분의 1의 푸티지를 잃을 수 있는 것과 달리, VTL은 전체 샷을 놓치지 않고 성공적으로 처리합니다. 또한 VTL은 거의 동일한 연속 프레임을 다시 촬영하지 않음으로써 낭비되는 프레임을 줄입니다. 핵심 메커니즘은 변화가 발생하는 순간에 프레임을 캡처하고, 중복을 버리고, 최소 및 최대 프레임 속도 제한을 적용하는 것을 포함합니다.VTL은 포괄적인 커버리지에 뛰어나지만, 항상 모든 곳에서 더 작은 간격을 만들지는 않습니다. 특정 경우에는 균일 샘플링이 더 작은 최대 간격을 생성할 수 있습니다. VTL의 강점은 이러한 "고정된 구간"을 명시적으로 식별하고 정량화하는 데 있으며, 간격을 설명되지 않은 채로 두지 않습니다. 커버리지 메트릭은 감지된 샷 경계를 기반으로 하며, 시스템이 보는 것을 신뢰할 수 있는 측정치를 제공합니다.VTL 측정의 정확성은 계산된 실제 데이터 및 독립적인 알고리즘과 엄격하게 테스트되었으며, 개발 중에 여러 버그를 발견하고 수정했습니다. 개발에서의 AI 지원은 인정되지만, 중요한 설계 결정 및 버그 발견 프로세스는 인간에 의해 주도되었습니다. 궁극적으로 VTL은 푸티지 내의 동적 변화에 초점을 맞춰 비디오 구간 분석을 추측에서 정확하고 정량화 가능한 데이터로 변환합니다.