Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Memory Modelling for Video Captioning

Junbo Wang, Wei Wang|arXiv (Cornell University)|2016. 11. 17.
Multimodal Machine Learning Applications참고 문헌 42인용 수 8
한 줄 요약

이 논문은 영상 설명 생성을 위한 다중모달 메모리 모델(M³)을 제안한다. M³은 공유 메모리를 통해 장기적인 시각-언어적 의존성을 모델링하고 전역적 시각 주의를 이끌어내는 데 사용된다. LSTM 기반 디코딩과 CNN 기반 영상 인코딩에 외부 메모리를 통합함으로써, MSVD 및 MSR-VTT에서 기존 최고 성능 모델을 초월하여 BLEU@4에서 최대 26.9% 향상되고 METEOR에서 8.5% 향상된 성능을 달성한다.

ABSTRACT

Video captioning which automatically translates video clips into natural language sentences is a very important task in computer vision. By virtue of recent deep learning technologies, e.g., convolutional neural networks (CNNs) and recurrent neural networks (RNNs), video captioning has made great progress. However, learning an effective mapping from visual sequence space to language space is still a challenging problem. In this paper, we propose a Multimodal Memory Model (M3) to describe videos, which builds a visual and textual shared memory to model the long-term visual-textual dependency and further guide global visual attention on described targets. Specifically, the proposed M3 attaches an external memory to store and retrieve both visual and textual contents by interacting with video and sentence with multiple read and write operations. First, text representation in the Long Short-Term Memory (LSTM) based text decoder is written into the memory, and the memory contents will be read out to guide an attention to select related visual targets. Then, the selected visual information is written into the memory, which will be further read out to the text decoder. To evaluate the proposed model, we perform experiments on two publicly benchmark datasets: MSVD and MSR-VTT. The experimental results demonstrate that our method outperforms the state-of-theart methods in terms of BLEU and METEOR.

연구 동기 및 목표

  • 장기간의 시각-언어적 의존성을 모델링하는 데 어려움을 겪는 기존 RNN 기반 모델이 장기간의 시퀀스에서 기울어짐 기울기 문제를 앓기 때문에, 영상 설명 생성에서 장기적인 시각-언어적 의존성을 모델링하는 데 도전한다.
  • 공유 메모리 메커니즘을 통해 관련 시각적 타겟 선택을 명시적으로 이끌어내어 전역적 시각 주의를 향상시킨다.
  • 단일 시각 표현과 LSTM 은닉 상태에만 의존하는 주의 메커니즘의 한계를 극복한다.
  • 다양한 벤치마크 데이터셋에서 영상 설명 생성 성능 향상에 다중모달 메모리가 어떻게 기여하는지 입증한다.
  • 다양한 시각 특징 추출기의 영향을 분석하고, 메모리 통합에 미치는 영향을 조사한다.

제안 방법

  • 다중 읽기 및 쓰기 연산을 통해 시각적 표현과 언어적 표현을 모두 저장하고 검색하는 다중모달 메모리 행렬(Mem)을 도입한다.
  • 프레임 단위의 특징을 추출하기 위해 CNN 기반 영상 인코더(예: Inception-V3, ResNet, VGG-19)를 사용하여 입력 영상 표현을 구성한다.
  • 이전 은닉 상태와 다중모달 메모리에서 읽은 내용에 조건을 두어 단어를 생성하는 LSTM 기반 텍스트 디코더를 구현한다.
  • LSTM 은닉 상태 대신 메모리 읽기 내용을 사용하여 시각 주의를 이끌어내어 보다 정확하고 전역적인 타겟 선택을 가능하게 한다.
  • 디코딩 단계당 두 번의 쓰기 연산을 수행한다: (1) LSTM 디코더 은닉 상태를 메모리에 쓰고, (2) 주의를 통해 선택된 시각적 특징을 메모리에 쓴다.
  • 양방향 메모리 상호작용을 가능하게 하여, 메모리에서 읽어와 주의와 디코더를 이끌고, 메모리에 쓰면서 다중모달 컨텍스트를 유지하고 업데이트한다.

실험 결과

연구 질문

  • RQ1공유된 다중모달 메모리가 영상 설명 생성에서 시각적 시퀀스와 언어적 시퀀스 간의 장기적 의존성을 효과적으로 모델링할 수 있는가?
  • RQ2LSTM 은닉 상태에 기반한 주의보다 메모리 읽기 내용을 사용해 시각 주의를 이끌면 생성된 설명의 관련성과 정확도가 향상되는가?
  • RQ3다양한 시각 특징 추출기(예: Inception-V3, VGG-19, C3D)에서 다중모달 메모리 통합이 성능에 어떤 영향을 미치는가?
  • RQ4제안된 M³ 모델이 MSVD 및 MSR-VTT와 같은 다양한 벤치마크에서 기존 최고 성능 모델을 일관되게 능가할 수 있는가?
  • RQ5다중모달 메모리와 결합했을 때, 운동 인식 특징(예: C3D)과 외관 전용 특징(예: VGG-19) 간의 기여도는 어떠한가?

주요 결과

  • MSVD에서 GoogleNet 특징을 사용할 경우, M³ 모델은 기준 모델인 SA 모델 대비 BLEU@4에서 26.9% 상대적 향상과 METEOR에서 8.5% 향상을 달성한다.
  • Inception-V3 특징을 사용한 M³-inception 모델은 MSVD에서 VGG-19, ResNet, GoogleNet 특징을 사용한 모델들을 모두 능가하는 최고의 성능을 기록한다.
  • MSR-VTT에서 M³ 모델은 항상 해당하는 SA 기준 모델을 능가하며, VGG-19와 C3D 특징을 사용한 M³-VC는 비교된 모든 방법보다 높은 BLEU 및 METEOR 점수를 기록한다.
  • MSR-VTT에서 C3D 특징(운동을 인코딩)을 사용할 경우 VGG-19 특징보다 더 높은 성능을 기록하여, 이 데이터셋에 대해 운동 정보가 핵심임을 시사한다.
  • 시각적 점검 결과, M³은 더 정확한 개체 용어(예: "basketball"은 "soccer ball" 대신)를 생성하고, 관련 타겟(예: "dog"은 "guitar" 대신)에 대해 전역 주의를 적용함을 확인할 수 있다.
  • 다양한 시각 특징을 사용한 모델의 성능 순위는 그들의 ImageNet 분류 정확도와 밀도 있게 상관관계를 보이며, 고품질의 시각 표현의 중요성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.