Skip to main content
QUICK REVIEW

[논문 리뷰] Finding the Right Moment: Human-Assisted Trailer Creation via Task Composition

Pinelopi Papalampidi, Frank Keller|arXiv (Cornell University)|2021. 11. 16.
Video Analysis and Summarization인용 수 5
한 줄 요약

이 논문은 영화 샷의 그래프 기반 모델을 사용하여 내러티브 구조 식별과 감정 예측으로 작업을 분해하는 인간 보조 트레일러 생성 프레임워크를 제안한다. 스크립트 기반의 특권 정보를 공동 대비 학습을 통해 활용함으로써, 경쟁적인 지도 학습 방법보다 인간 평가자들이 선호하는 트레일러를 생성하며, 전환점(턴링 포인트)을 구조적 사전 지식으로 통합했을 때 가장 뛰어난 성능을 기록한다.

ABSTRACT

Movie trailers perform multiple functions: they introduce viewers to the story, convey the mood and artistic style of the film, and encourage audiences to see the movie. These diverse functions make trailer creation a challenging endeavor. In this work, we focus on finding trailer moments in a movie, i.e., shots that could be potentially included in a trailer. We decompose this task into two subtasks: narrative structure identification and sentiment prediction. We model movies as graphs, where nodes are shots and edges denote semantic relations between them. We learn these relations using joint contrastive training which distills rich textual information (e.g., characters, actions, situations) from screenplays. An unsupervised algorithm then traverses the graph and selects trailer moments from the movie that human judges prefer to ones selected by competitive supervised approaches. A main advantage of our algorithm is that it uses interpretable criteria, which allows us to deploy it in an interactive tool for trailer creation with a human in the loop. Our tool allows users to select trailer shots in under 30 minutes that are superior to fully automatic methods and comparable to (exclusive) manual selection by experts.

연구 동기 및 목표

  • 내러티브 구조와 정서적 흐름을 이해해야 하는 자동 영화 트레일러 생성 과제를 해결하기 위해.
  • 트레일러 생성을 두 가지 하위 과제로 분해하기 위해: 핵심 내러티브 전환점 식별과 샷 간 감정 강도 예측.
  • 비디오 수준의 레이블링에 비용이 많이 들기 때문에, 훈련 중에 스크립트 데이터를 특권 정보로 활용하여 모델 성능을 향상시키기 위해.
  • 일관되고 인간이 선호하는 트레일러를 생성하기 위해 비지도 그래프 탐색 알고리즘을 개발하기 위해.
  • 콘텐츠의 정보성과 매력성에 대해 인간 평가를 통해 모델의 효과성을 평가하기 위해.

제안 방법

  • 노드가 샷을 나타내고, 스크립트에 주석이 달린 사건에서 유도된 의미적 관계가 간선이 되는 그래프로 영화를 모델링한다.
  • 스토리보드 텍스트와 비디오 특징을 각각 사용하는 이중 네트워크 대비 학습 프레임워크를 훈련하며, 대비 손실을 통해 공유 표현 학습을 수행한다.
  • 스크립트 데이터를 사용해 노드를 전환점 유형(예: 클라이맥스, 주요 좌절)으로 레이블링하고, 샷에 감정 점수를 할당한다.
  • 트레일러 제안을 위해 영화 그래프에서 비지도 랜덤 워크 전략을 적용하여 샷을 선택하고 순서를 정한다.
  • 통합된 전환점 정보를 구조적 사전 지식으로 활용하여 탐색을 안내함으로써, 일관성과 매력도를 향상시킨다.
  • 아마존 메카니컬 터크를 통해 인간 평가를 실시하며, 최고-최악 스케일링을 사용하여 정보성과 매력성 기준으로 트레일러 순위를 매긴다.

실험 결과

연구 질문

  • RQ1내러티브 구조 식별과 감정 예측으로 트레일러 생성을 분해하면 자동 트레일러 품질이 향상되는가?
  • RQ2대비 학습을 통해 스크립트 데이터를 특권 정보로 활용하면, 트레일러 생성을 위한 샷 수준 표현 학습이 향상되는가?
  • RQ3전환점 정보를 구조적 사전 지식으로 통합하면, 생성된 트레일러의 일관성과 인간 선호도에 어떤 영향을 미치는가?
  • RQ4비지도 그래프 탐색 방법이 지도 학습 기반 보다 정보성과 매력성이 높은 트레일러를 생성하는 데 성공할 수 있는가?
  • RQ5생성된 트레일러에 스포일러가 얼마나 포함되어 있으며, 이를 피하는 것이 품질을 떨어뜨리는가?

주요 결과

  • 전환점 정보를 포함한 GraphTrailer는 정보성(Q1)과 매력성(Q2) 모두에서 가장 높은 인간 선호도를 기록했으며, 다른 모든 모델을 압도했다.
  • 전환점 정보가 포함된 모델는 거의 항상 최악으로 선택되지 않아 일관된 품질을 보였고, 전환점 없이 학습된 모델는 최고이자 최악으로 자주 선택되어 품질의 변동성이 크다는 것을 시사했다.
  • 지도 학습 기반 GraphTrailer와 전환점 없이 학습된 GraphTrailer는 각각 24.40%와 22.50%의 비율로 최고로 선택되었지만, 동시에 최악으로도 자주 선택되어 품질의 변동성이 높다는 것을 보여주었다.
  • 스크립트 데이터를 활용한 대비 학습은 모델 성능을 크게 향상시켰으며, 비디오 수준의 레이블링이 필요 없이도 더 나은 샷 수준 표현 학습이 가능하게 했다.
  • 최종 두 전환점(주요 좌절, 클라이맥스)의 샷을 포함함에도 불구하고, 모델은 과도한 스포일러를 생성하지 않았으며, 12개의 테스트 트레일러 랜덤 샘플 중에서 오직 한 건의 주요 스포일러만 발견되었다.
  • 도메인 내 데이터 없이 세분화된 감정 예측은 신뢰할 수 없었기 때문에, 감정 강도의 안정적인 대체 지표로 양성/음성 감정 점수를 사용하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.