Skip to main content
QUICK REVIEW

[논문 리뷰] Reconstruct and Represent Video Contents for Captioning via Reinforcement Learning

Wei Zhang, Bairui Wang|arXiv (Cornell University)|2019. 06. 03.
Multimodal Machine Learning Applications참고 문헌 68인용 수 5
한 줄 요약

이 논문은 전방(비디오 → 문장)과 역방향(문장 → 비디오) 흐름을 이중 학습 메커니즘을 통해 통합하는 새로운 비디오 캡션 프레임워크인 RecNet을 제안한다. 디코더의 은닉 상태에서 비디오 특징을 복원하기 위해 전역 및 국소 복원기(Reconstructor)를 활용하고, 교차 엔트로피와 CIDEr 기반 강화 학습을 함께 최적화함으로써 노출 편향을 줄이고 비디오와 텍스트 간의 의미적 일치를 향상시켜 캡션 생성 성능을 크게 향상시킨다.

ABSTRACT

In this paper, the problem of describing visual contents of a video sequence with natural language is addressed. Unlike previous video captioning work mainly exploiting the cues of video contents to make a language description, we propose a reconstruction network (RecNet) in a novel encoder-decoder-reconstructor architecture, which leverages both forward (video to sentence) and backward (sentence to video) flows for video captioning. Specifically, the encoder-decoder component makes use of the forward flow to produce a sentence description based on the encoded video semantic features. Two types of reconstructors are subsequently proposed to employ the backward flow and reproduce the video features from local and global perspectives, respectively, capitalizing on the hidden state sequence generated by the decoder. Moreover, in order to make a comprehensive reconstruction of the video features, we propose to fuse the two types of reconstructors together. The generation loss yielded by the encoder-decoder component and the reconstruction loss introduced by the reconstructor are jointly cast into training the proposed RecNet in an end-to-end fashion. Furthermore, the RecNet is fine-tuned by CIDEr optimization via reinforcement learning, which significantly boosts the captioning performance. Experimental results on benchmark datasets demonstrate that the proposed reconstructor can boost the performance of video captioning consistently.

연구 동기 및 목표

  • 기존의 비디오 캡션 모델이 전방 흐름(비디오 → 문장)에만 의존하여 생성된 캡션에서 비디오로의 역방향 정보를 忽略하는 한계를 해결하고자 한다.
  • 자기회귀적 디코딩에서 내재된 노출 편향을 줄이기 위해 역방향 복원을 정규화 요소로 활용하고자 한다.
  • 복원 및 생성 손실을 함께 훈련시켜 비디오 콘텐츠와 자연어 기술 간의 의미적 일치를 향상시키고자 한다.
  • CIDEr와 같은 인간 중심 평가 지표를 직접 최적화하기 위해 강화 학습을 통한 피취조정을 통해 성능을 향상시키고자 한다.
  • 디코더 은닉 상태에서 전역 및 국소 비디오 특징을 모두 복원함으로써 캡션 품질 향상이 이루어지는지 입증하고자 한다.

제안 방법

  • CNN를 사용해 비디오 프레임을 시계열 표현으로 처리하는 인코더, 비디오 특징에서 자동으로 문장을 생성하는 디코더(LSTM/GRU)를 포함한 인코더-디코더-복원기 아키텍처를 제안한다.
  • 전역 복원기는 전체 비디오 표현을 복원하고, 국소 복원기는 디코더 은닉 상태에서 프레임 수준의 특징을 복원하는 두 가지 복원기를 도입한다.
  • 복원 손실(Eq. 12 및 Eq. 14)을 사용해 복원기를 훈련시키며, 이는 역전파를 통해 인코더와 디코더를 정규화한다.
  • 생성 손실(교차 엔트로피)과 복원 손실을 조합하여 종합적인 훈련 목표(Eq. 22)를 설정하고, 엔드 투 엔드 최적화를 수행한다.
  • CIDEr 점수를 최적화하기 위해 REINFORCE 알고리즘을 사용해 모델을 피취조정함으로써 인간 평가 지표를 직접 최적화할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1생성된 캡션에서 비디오로의 역방향 정보가 비디오 캡션 성능 향상에 기여하는가?
  • RQ2디코더 은닉 상태에서 전역 및 국소 비디오 특징을 모두 복원함으로써 자기회귀적 캡션에서의 노출 편향이 감소하는가?
  • RQ3복원 및 생성 손실을 함께 훈련시킴으로써 비디오와 텍스트 간의 의미적 일치가 향상되는가?
  • RQ4CIDEr 기반 강화 학습을 통한 피취조정이 표준 교차 엔트로피 훈련을 초월해 캡션 품질을 얼마나 향상시키는가?
  • RQ5국소 복원기와 전역 복원기는 의미 있는 시각적 특징을 복원하는 데 있어 어떤 정도의 성능을 보이는가?

주요 결과

  • 전역 및 국소 복원기를 모두 갖춘 RecNet은 벤치마크 비디오 캡션 데이터셋에서 최신 기술 수준의 성능을 달성하며, 표준 인코더-디코더 모델을 능가한다.
  • 훈련 과정에서 복원 손실이 감소함을 확인하여 복원기가 디코더 은닉 상태에서 비디오 특징을 성공적으로 재구성하고 있음을 나타낸다.
  • RecNet을 사용할 경우 디코더의 은닉 상태 분포가 훈련 단계와 추론 단계에서 더 일관성이 있게 되어 노출 편향이 감소한다.
  • 정성적 결과에서는 RecNet이 기존 모델이 실패하는 경우에도 '메이크업'이나 '얼굴'과 같은 정확하고 기술적인 캡션을 생성함을 확인할 수 있다.
  • CIDEr 기반 강화 학습을 통한 피취조정이 성능 향상에 추가로 기여함을 입증하여 지표 기반 최적화의 효과성을 보여준다.
  • 전역 및 국소 복원기의 융합은 각각을 별도로 사용하는 것보다 더 우수한 성능을 내어, 두 관점의 상호 보완성이 확인된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.