Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond Caption To Narrative: Video Captioning With Multiple Sentences

Andrew Shin, Katsunori Ohnishi|arXiv (Cornell University)|2016. 05. 18.
Multimodal Machine Learning Applications참고 문헌 29인용 수 6
한 줄 요약

이 논문은 동작 정위(동작 국소화)를 통해 영상을 세분화하고, 자연어 처리 기법을 사용해 문장들을 연결함으로써 다수의 서술문장을 생성하는 스토리 같은 영상 캡션 방법을 제안한다. 영상 수준의 특징을 사용하지 않아도 최신 기법들과 경쟁 가능한 성능을 달성하며, 단일 프레임 기반 기법보다 더 풍부하고 다이나믹한 캡션을 생성한다.

ABSTRACT

Recent advances in image captioning task have led to increasing interests in video captioning task. However, most works on video captioning are focused on generating single input of aggregated features, which hardly deviates from image captioning process and does not fully take advantage of dynamic contents present in videos. We attempt to generate video captions that convey richer contents by temporally segmenting the video with action localization, generating multiple captions from multiple frames, and connecting them with natural language processing techniques, in order to generate a story-like caption. We show that our proposed method can generate captions that are richer in contents and can compete with state-of-the-art method without explicitly using video-level features as input.

연구 동기 및 목표

  • 단일 문장 이미지 캡션 접근 방식을 넘어서 더 풍부하고 스토리 같은 영상 캡션을 생성하기 위해.
  • 영상의 동적 내용을 포괄하지 못하는 단일 통합 영상 특징의 한계를 해결하기 위해.
  • 시간적으로 분할된 영상 동작에서 일관되고 서사적인 문장들을 다수 생성하는 방법을 개발하기 위해.
  • 서사적 일관성을 확보하기 위해 영상 수준의 특징이나 외부 텍스트 데이터에 의존하지 않기 위해.

제안 방법

  • 촬영 전환 또는 장면 전환이 아닌 동작 변화에 기반해 동작 국소화를 통해 영상을 시간적으로 분할한다.
  • 각 동작 세그먼트의 중간 프레임에서 CNN 특징(VGG-16 fc7)을 추출하여 캡션 생성에 사용한다.
  • MS COCO 데이터셋으로 미세조정된 LSTM 모델을 사용해 각 세그먼트별로 개별 캡션을 생성한다.
  • 자연어 처리 기법을 적용해 다수의 캡션을 유창하고 서사적인 문장 조각으로 연결한다.
  • 동작 국소화 과정에서 영상 수준 표현을 위해 피셔 벡터 인코딩을 사용하고, 주성분 분석(PCA)과 L2 정규화를 적용한다.
  • 캡션 모델의 입력으로 영상 수준의 특징을 사용하지 않으며, 오직 프레임 수준의 CNN 특징에 의존한다.

실험 결과

연구 질문

  • RQ1단일 캡션 대신 다수의 문장을 생성함으로써 영상 캡션 성능을 향상시킬 수 있는가?
  • RQ2촬영 전환 또는 장면 전환 기반의 분할 대비 동작 기반 시간 분할이 더 일관되고 내용이 풍부한 영상 캡션을 유도하는가?
  • RQ3외부 텍스트 데이터 없이 독립적으로 생성된 캡션에 자연어 처리 기법을 적용함으로써 서사적 일관성을 달성할 수 있는가?
  • RQ4명시적인 영상 수준 특징 없이도 영상 캡션에서 최신 기법의 성능을 유지할 수 있는가?
  • RQ5편집 빈도가 낮은 비영화 영상에서 이 방법은 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 방법은 모든 데이터셋과 평가 지표에서 단일 프레임 기반 기준보다 뛰어난 성능을 보이며, 더 풍부한 내용을 담고 있음을 입증한다.
  • 최신 기법보다 약 4배 긴 캡션을 생성함에도 불구하고 BLEU, ROUGE, CIDEr 점수는 유사하게 유지되어 높은 내용 정합성을 보여준다.
  • MSVD 데이터셋에서, 이 방법은 기준 기준보다 더 높은 CIDEr 및 ROUGE 점수를 기록하여 인간이 작성한 캡션과의 일치도가 뛰어나다는 것을 확인한다.
  • 편집 빈도가 낮은 유튜브 영상의 MSVD 서브셋에서, 이 방법은 대부분의 평가 지표에서 단일 프레임 접근 방식을 능가했으며, 영화 클립 외부 영역에서도 강건함을 입증한다.
  • 정성적 결과에서는 생성된 캡션이 일관되고 서사적인 문장 조각을 형성하며, 문장 간 전환도 매끄럽게 이루어짐을 확인할 수 있다.
  • 영상 수준의 특징을 사용하지 않음에도 불구하고 더 정보가 풍부한 캡션을 성공적으로 생성함으로써, 프레임 수준의 특징과 세분화, 자연어 처리 기법의 조합이 강력한 성능을 낼 수 있음을 증명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.