Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Trailer Moments in Full-Length Movies

Lezi Wang, Dong Liu|arXiv (Cornell University)|2020. 08. 19.
Video Analysis and Summarization참고 문헌 40인용 수 6
한 줄 요약

이 논문은 공식 트레일러를 약한 지도 신호로 사용하여 전장 영화에서 트레일러 순간을 탐지하기 위한 약한 지도 학습 모델인 CCANet을 제안한다. 영화와 트레일러 샷 간의 공액 주의를 활용하여 약한 레이블을 생성하고, 대비 주의 모듈을 통해 특징의 구별 능력을 향상시킴으로써, 공개 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, TVSum 데이터셋에서는 6.5% mAP 높은 성능을 기록했고, TMDD에서는 오히려 지도 학습 기반 기준을 초월하였다.

ABSTRACT

A movie's key moments stand out of the screenplay to grab an audience's attention and make movie browsing efficient. But a lack of annotations makes the existing approaches not applicable to movie key moment detection. To get rid of human annotations, we leverage the officially-released trailers as the weak supervision to learn a model that can detect the key moments from full-length movies. We introduce a novel ranking network that utilizes the Co-Attention between movies and trailers as guidance to generate the training pairs, where the moments highly corrected with trailers are expected to be scored higher than the uncorrelated moments. Additionally, we propose a Contrastive Attention module to enhance the feature representations such that the comparative contrast between features of the key and non-key moments are maximized. We construct the first movie-trailer dataset, and the proposed Co-Attention assisted ranking network shows superior performance even over the supervised approach. The effectiveness of our Contrastive Attention module is also demonstrated by the performance improvement over the state-of-the-art on the public benchmarks.

연구 동기 및 목표

  • 인간 애너테이션 없이 공식적으로 배포된 트레일러를 약한 지도 신호로 활용하여 전장 영화에서 트레일러 순간 탐지에 필요한 애너테이션 데이터 부족 문제를 해결하고자 한다.
  • 비용이 많이 드는 인간 애너테이션을 피하면서도 높은 탐지 정확도를 유지할 수 있는 약한 지도 학습 프레임워크를 개발하고자 한다.
  • 특징 공간에서 트레일러와 비트레일러 순간 간의 대비 관계를 모델링하여 특징 표현을 향상시키고자 한다.
  • 미래의 트레일러 순간 탐지 연구를 지원하기 위해, 처음으로 대규모 영화-트레일러 데이터셋인 TMDD를 구축하고자 한다.
  • 주의 기반 지도 신호와 특징 증강을 적절히 설계한 약한 지도 학습 모델이 지도 학습 기반 기준을 능가할 수 있음을 입증하고자 한다.

제안 방법

  • 전장 영화의 샷과 그에 대응하는 공식 트레일러 샷 간의 공액 주의를 활용하여 '트레일러성' 점수를 추정하고, 약한 양/음성 학습 쌍을 생성한다.
  • 트레일러 순간 특징 간 유사도를 극대화하고 비트레일러 특징과의 대비를 증가시켜 밀집된 특징 클리크를 형성하는 대비 주의 모듈을 도입한다.
  • 시공간적 특징 추출을 위해 3D CNN 백본을 사용하고, 각 샷의 트레일러성에 따라 점수를 매기는 랭킹 헤드를 적용한다.
  • 트레일러와 높은 유사도를 보이는 샷에 대해 더 높은 점수를 매기도록 유도하는 대비 랭킹 손실을 사용하여 모델을 종합적으로 학습한다.
  • UMAP 시각화를 통해 대비 주의 증강 이후 특징의 분리 능력 향상 여부를 확인한다.
  • 전체 150편의 전장 영화와 그에 대응하는 공식 트레일러를 포함하여 총 300시간이 넘는 영상 자료를 포함한 TMDD 데이터셋을 구축한다.

실험 결과

연구 질문

  • RQ1공식 영화 트레일러를 약한 지도 신호로 효과적으로 활용하여 인간 애너테이션 없이 핵심 트레일러 순간을 탐지할 수 있는가?
  • RQ2영화와 트레일러 샷 간의 공액 주의를 어떻게 활용하여 학습에 유용한 약한 레이블을 생성할 수 있는가?
  • RQ3대비 주의 메커니즘이 트레일러와 비트레일러 순간 간의 특징 구별 능력을 향상시켜 일반화 능력을 향상시킬 수 있는가?
  • RQ4적절히 설계된 약한 지도 학습 모델이 공개 벤치마크에서 비디오 하이라이트 탐지에 있어 기존의 지도 학습 접근법을 능가할 수 있는가?
  • RQ5대비 주의를 통한 특징 증강이 모델의 강건성과 성능 향상에 얼마나 기여하는가?

주요 결과

  • 제안된 CCANet 모델은 TVSum 데이터셋에서 모든 지도 학습 기반 기준을 초월하여, 다음으로 우수한 성능을 보인 LM보다 6.5% 높은 mAP를 기록하였다.
  • TVSum 데이터셋에서 CCANet는 상위 5개의 mAP 0.628을 기록하였으며, 최신 기술 수준의 지도 학습 방법인 SubMod보다 16.7% 높았다.
  • YouTube 하이라이트 데이터셋에서 CCANet는 mAP 0.691을 기록하여 최고의 베이스라인인 LSVM을 15.5% 초월하였다.
  • UMAP 시각화 결과, 대비 주의가 하이라이트와 비하이라이트 순간 간의 특징 분리 능력을 크게 향상시켰음을 확인하였다.
  • 공액 주의 메커니즘은 트레일러와 영화 간에 시각적으로 유사한 샷을 성공적으로 식별하여 관련 있는 영화 샷에 높은 점수를 할당하였다.
  • 세계 최초로 제작된 TMDD 데이터셋은 트레일러 순간 탐지 평가를 가능하게 하였으며, 향후 연구를 위한 상당한 향상 여지가 있음을 드러내었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.