Skip to main content
QUICK REVIEW

[논문 리뷰] Title Generation for User Generated Videos

Kuo-Hao Zeng, Tseng-Hung Chen|arXiv (Cornell University)|2016. 08. 25.
Multimodal Machine Learning Applications참고 문헌 45인용 수 9
한 줄 요약

이 논문은 영상 캡션과는 별개로 영상 제목 생성을 새로운 과제로 제안하며, 제목 품질을 향상시키기 위해 두 가지 방법을 제안한다: 핵심 이벤트를 동시에 국소화하고 요약된, 집중력을 요하는 제목을 생성하는 하이라이트 민감 캡셔너, 그리고 언어적 다양성을 높이기 위해 더미 영상 임베딩을 사용한 문장 증강. 이 방법은 새로 수집한 VTW 데이터셋에서 최신 기술 성능을 달성했으며, 인간 평가 결과 기준 기존 모델 대비 59.5%의 생성 제목이 더 우수한 것으로 평가되었다.

ABSTRACT

A great video title describes the most salient event compactly and captures the viewer's attention. In contrast, video captioning tends to generate sentences that describe the video as a whole. Although generating a video title automatically is a very useful task, it is much less addressed than video captioning. We address video title generation for the first time by proposing two methods that extend state-of-the-art video captioners to this new task. First, we make video captioners highlight sensitive by priming them with a highlight detector. Our framework allows for jointly training a model for title generation and video highlight localization. Second, we induce high sentence diversity in video captioners, so that the generated titles are also diverse and catchy. This means that a large number of sentences might be required to learn the sentence structure of titles. Hence, we propose a novel sentence augmentation method to train a captioner with additional sentence-only examples that come without corresponding videos. We collected a large-scale Video Titles in the Wild (VTW) dataset of 18100 automatically crawled user-generated videos and titles. On VTW, our methods consistently improve title prediction accuracy, and achieve the best performance in both automatic and human evaluation. Finally, our sentence augmentation method also outperforms the baselines on the M-VAD dataset.

연구 동기 및 목표

  • 전체 영상 기술보다 간결하고 시선을 끄는 영상 제목을 생성하는 데 도전하는 것.
  • 비트림드 사용자 생성 영상에서 주목할 만한 이벤트(하이라이트)에 초점을 맞춘 영상 캡처를 가능하게 하는 것.
  • 실제 사용에서 매우 다양하게 변하는 영상 제목의 언어적 다양성을 향상시키는 것.
  • 비디오가 없는 문장만으로 구성된 예제를 사용해 영상 캡처를 훈련하는 방법을 개발하는 것.
  • 대규모로 수집된, 개방형 도메인의 비트림드 사용자 생성 영상과 제목을 포함한 데이터셋을 구축하고 공개하여 벤치마크를 제공하는 것.

제안 방법

  • 비트림드 영상에서 주목할 만한 순간을 국소화하는 동시에 영상 캡처를 훈련하는 하이라이트 민감 캡처를 도입한다.
  • 하이라이트 감독을 통한 소프트 어텐션 메커니즘을 강화하여 제목이 일반적인 영상 콘텐츠가 아닌 핵심 이벤트를 묘사하도록 보장한다.
  • 더미 영상 관측치를 사용한 문장 증강 기법을 제안하여, 추가적인 문장 전용 데이터로 캡처를 훈련시켜 언어 모델의 다양성을 향상시킨다.
  • 훈련 중에 모든 증강된 문장을 하나의 더미 영상 임베딩에 할당하여 영상-제목 쌍과 문장 전용 예제를 모두 사용해 훈련한다.
  • 웹에서 크롤링한 문장을 추가 훈련 데이터로 활용하여 제목에서의 다양한 언어 패턴을 시뮬레이션한다.
  • 제안된 방법을 사용해 기존의 영상 캡처 모델(S2VT 및 SA)을 미세조정하여 제목 생성에 적합하게 조정한다.

실험 결과

연구 질문

  • RQ1영상 캡처 모델이 전체 영상 기술 대신 간결하고 하이라이트 중심의 제목을 생성하도록 적응시킬 수 있는가?
  • RQ2비트림드 영상에서 가장 주목할 만한 이벤트를 국소화하고 그 순간만 묘사하는 제목을 생성할 수 있는 모델은 어떻게 훈련할 수 있는가?
  • RQ3비디오 컨텍스트 없이 문장 전용 데이터로 훈련하면 영상 제목의 언어적 다양성을 향상시킬 수 있는가?
  • RQ4더미 영상 임베딩을 사용한 문장 증강이 제목 생성 성능을 효과적으로 향상시키는가?
  • RQ5제안된 방법은 새로 개발한 VTW 데이터셋 외의 다른 영상 기술 데이터셋에도 일반화 가능한가?

주요 결과

  • 하이라이트 민감 캡처(HL)는 자동 평가 및 인간 평가 모두에서 베이직 캡처보다 뛰어난 성능을 보이며, VTW 데이터셋에서 CIDEr 24.9%, METEOR 6.2%를 기록했다.
  • 하이라이트 민감성과 웹 기반 문장 증강의 조합(HL+Web Aug.)이 가장 뛰어난 성능을 보였으며, S2VT 기준 CIDEr 25.4%, METEOR 6.2%, SA 기준 CIDEr 25.1%, METEOR 5.7%를 기록했다.
  • 인간 평가 결과, 전체 방법(HL+Web Aug.)으로 생성된 제목 중 59.5%가 베이직 모델 대비 동등하거나 더 낫다고 평가되었다.
  • 문장 증강 방법은 M-VAD 데이터셋에서도 성능 향상을 이끌었으며, S2VT 기준 7.1% METEOR를 기록해 기존 S2VT 기준 6.7% 대비 향상되었다.
  • 통합 훈련을 거친 후 하이라이트 검출기의 mAP는 54.2%에서 58.3%로 향상되어 엔드 투 엔드 최적화의 유용성을 확인했다.
  • 정답 하이라이트가 없더라도 자동으로 검출된 하이라이트를 기반으로 훈련된 모델(HL-0)이 CIDEr 22.4%를 기록해 약한 지도 학습에 대한 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.