Skip to main content
QUICK REVIEW

[논문 리뷰] An Attempt towards Interpretable Audio-Visual Video Captioning

Yapeng Tian, Chenxiao Guan|arXiv (Cornell University)|2018. 12. 07.
Multimodal Machine Learning Applications참고 문헌 49인용 수 16
한 줄 요약

이 논문은 단어 생성 중에 해석 가능한 모odal 선택을 갖는 청각-시각 영상 요약을 위한 다중모달 컨volution 신경망(MM-CNN)을 제안한다. 정의된 활성화 에너지와 함께 모odal 인식 특징 집합 모듈을 도입함으로써, 각 생성된 단어에 대해 시각적 또는 청각적 특징이 더 영향을 미치는지 식별할 수 있으며, 이는 최첨단 성능을 달성하면서도 생성된 요약문에서 모odal 기여도를 명확히 해석할 수 있도록 한다.

ABSTRACT

Automatically generating a natural language sentence to describe the content of an input video is a very challenging problem. It is an essential multimodal task in which auditory and visual contents are equally important. Although audio information has been exploited to improve video captioning in previous works, it is usually regarded as an additional feature fed into a black box fusion machine. How are the words in the generated sentences associated with the auditory and visual modalities? The problem is still not investigated. In this paper, we make the first attempt to design an interpretable audio-visual video captioning network to discover the association between words in sentences and audio-visual sequences. To achieve this, we propose a multimodal convolutional neural network-based audio-visual video captioning framework and introduce a modality-aware module for exploring modality selection during sentence generation. Besides, we collect new audio captioning and visual captioning datasets for further exploring the interactions between auditory and visual modalities for high-level video understanding. Extensive experiments demonstrate that the modality-aware module makes our model interpretable on modality selection during sentence generation. Even with the added interpretability, our video captioning network can still achieve comparable performance with recent state-of-the-art methods.

연구 동기 및 목표

  • 다중모달 영상 요약에서 청각 및 시각적 특징가 블랙박스 방식으로 융합되는 해석 불가능성 문제를 해결하기 위해.
  • 생성된 문장의 각 단어에 대해 어떤 모달(청각 또는 시각)이 더 많은 기여를 하는지 명시적으로 드러내는 영상 요약 프레임워크를 설계하기 위해.
  • 새로 수집한 데이터셋을 통해 청각 및 시각 모달 간의 고수준 의미적 상관관계를 탐색하기 위해.
  • 영상 요약 작업에서 한 모달이 다른 모달의 고수준 의미를 추론할 수 있는지 평가하기 위해.
  • 해석 가능성이 최첨단 방법과 성능을 떨어뜨리지 않고도 달성될 수 있음을 보여주기 위해.

제안 방법

  • 재귀적 디코더 없이 설계된 다중모달 컨volution 신경망(MM-CNN) 아키텍처를 제안하여, 더 쉽게 해석 가능한 구조를 설계할 수 있도록 한다.
  • 각 단어 생성 단계에서 지배적인 모달을 결정하기 위해 활성화 에너지를 계산하는 모달 인식 특징 집합 모듈을 도입한다.
  • 정의된 활성화 에너지 점수를 사용하여 각 단어 생성 단계에서 청각적 특징과 시각적 특징의 기여도를 정량화하고 시각화한다.
  • 공유된 디코더 헤드를 갖는 이중 브랜치 인코더(청각 및 시각)를 사용하여 다중모달 특징에서 자연어 기술을 생성한다.
  • 교차 모달 의미 추론 및 모달 상호작용을 연구하기 위해 새로운 청각 요약(AC) 및 시각 요약(VC) 데이터셋을 수집한다.
  • 표준 요약 평가 지표(BLEU, METEOR, ROUGE-L, CIDEr)를 사용하여 MSR-VTT 및 새로운 AC/VC 데이터셋에서 모델을 훈련하고 평가한다.

실험 결과

연구 질문

  • RQ1각 단어 생성에 대해 어떤 모달(청각 또는 시각)이 더 영향을 미치는지 명시적으로 드러내는 영상 요약 모델을 설계할 수 있는가?
  • RQ2청각 및 시각 모달 간의 의미적 상관관계는 영상 이해 작업(예: 요약)에서 고수준에서 얼마나 강한가?
  • RQ3직접적인 감독 없이 청각 모달이 고수준의 시각적 의미(예: 행동, 사건)를 추론할 수 있으며, 반대로 시각 모달도 마찬가지로 가능한가?
  • RQ4모달 선택의 해석 가능성을 도입함으로써 블랙박스 융합 방법 대비 전체 요약 성능이 떨어지는가?
  • RQ5네트워크 깊이(잔차 블록 수)는 다중모달 요약에서 성능 및 일반화에 어떤 영향을 미치는가?

주요 결과

  • 모달 인식 모듈은 시각화를 통해 각 생성된 요약문의 각 단어에 대해 어떤 모달(청각 또는 시각)이 더 영향을 미치는지 명확히 하여 해석 가능성을 성공적으로 구현하였다(예: 빨간색은 청각, 파란색은 시각).
  • 10개의 잔차 블록을 사용하여 MSR-VTT에서 경쟁력 있는 성능을 달성하였으며, BLEU-4는 42.2, METEOR는 28.3, ROUGE-L는 61.4, CIDEr는 48.0을 기록하였다.
  • 10개 블록을 가진 모델가 5개 및 15개 블록 버전보다 우수한 성능을 보였으며, 이는 데이터셋 크기 제한으로 인해 더 깊은 네트워크가 항상 성능 향상에 기여하지는 않는다는 것을 시사한다.
  • V2A(시각 → 청각) 작업이 약간 더 높은 성능을 보였으며, 이는 시각적 특징이 청각 요약에서 더 정보가 많다는 것을 시사한다. 이는 시각적 단서가 청각 해석을 보조하기 때문일 것이다.
  • A2V(청각 → 시각) 작업은 V2A보다 약간 낮은 성능을 보였지만 여전히 의미 있는 성능를 보였으며, 이는 청각이 시각적 의미를 추론할 수는 있지만, 시각적 특징만큼 효과적으로 작용하지는 않는다는 것을 시사한다.
  • 청각 및 시각 모달 간 강한 상관관계가 확인되었다: 시각 콘텐츠는 청각 이벤트(예: 노래하기)를 추론하는 데 도움을 주며, 청각 콘텐츠는 시각 이벤트(예: 대화, 요리)를 추론하는 데 도움을 주며, 소음 조건에서도 성립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.