Skip to main content
QUICK REVIEW

[논문 리뷰] Multilevel Hierarchical Network with Multiscale Sampling for Video Question Answering

Min Peng, Chongyang Wang|arXiv (Cornell University)|2022. 05. 09.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 비디오 질의 응답(VQA)를 위한 다중 수준 계층적 네트워크(MHN)를 제안하며, 다양한 시간 해상도에서의 다중 척도 시각적 외관-운동 특징을 통합하고 다중 수준 딥 러닝 표현과 결합한다. 이 방법은 반복적으로 질문을 안내하는 시각적 특징을 다양한 척도에서 정밀하게 다듬는 순환 다중모odal 상호작용 모듈과, 공유된 트랜스포머 인코더를 사용하는 병렬 시각적 추론 모듈을 통해 다중 수준 표현을 동시에 추론한다. 이로 인해 TGIF-QA, MSRVTT-QA, MSVD-QA 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Video question answering (VideoQA) is challenging given its multimodal combination of visual understanding and natural language processing. While most existing approaches ignore the visual appearance-motion information at different temporal scales, it is unknown how to incorporate the multilevel processing capacity of a deep learning model with such multiscale information. Targeting these issues, this paper proposes a novel Multilevel Hierarchical Network (MHN) with multiscale sampling for VideoQA. MHN comprises two modules, namely Recurrent Multimodal Interaction (RMI) and Parallel Visual Reasoning (PVR). With a multiscale sampling, RMI iterates the interaction of appearance-motion information at each scale and the question embeddings to build the multilevel question-guided visual representations. Thereon, with a shared transformer encoder, PVR infers the visual cues at each level in parallel to fit with answering different question types that may rely on the visual information at relevant levels. Through extensive experiments on three VideoQA datasets, we demonstrate improved performances than previous state-of-the-arts and justify the effectiveness of each part of our method.

연구 동기 및 목표

  • 기존의 VQA 방법들이 다양한 시간 해상도에서의 다중 척도 시각적 외관-운동 정보를 간과하는 격차를 보완하기 위해.
  • 딥 뉴럴 네트워크의 다중 수준 표현 학습 능력과 다중 척도 시각적 특징을 효과적으로 통합하는 방법을 탐구하기 위해.
  • 다양한 질문 유형을 고려한 질문을 안내하는, 척도 인식 시각적 추론을 지원하는 모델 아키텍처를 설계하기 위해.
  • 계층적이고 반복적인 다중모달 상호작용 및 다중 수준에서의 병렬 시각적 추론을 통해 VQA 성능을 향상시키기 위해.

제안 방법

  • 모델은 입력 비디오에서 다양한 시간 해상도의 프레임 그룹을 다중 척도 샘플링을 통해 추출한다.
  • 순환 다중모달 상호작용(RMI) 모듈은 스택된 순환 연결 다중모달 블록을 사용하여 다양한 척도에서 질문을 안내하는 시각적 표현을 반복적으로 정밀하게 다듬는다.
  • 각 다중모달 상호작용 블록은 특정 척도의 프레임 그룹을 처리하며, 질문 임bedding과 외관-운동 특징 간의 교차 어텐션을 수행한다.
  • 병렬 시각적 추론(PVR) 모듈은 모든 RMI 블록의 출력을 동시에 처리하기 위해 공유된 트랜스포머 인코더를 적용하여 수준 간의 공동 추론을 가능하게 한다.
  • PVR 내 공유된 트랜스포머 인코더는 파rameter를 줄이면서도 강력한 특징 융합 및 추론 능력을 유지한다.
  • 이 아키텍처는 TGIF-QA, MSRVTT-QA, MSVD-QA 세 가지 VQA 벤치마크에서 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1다중 척도 시각적 외관-운동 특징을 어떻게 효과적으로 딥 러닝 모델에 통합할 수 있는가?
  • RQ2다양한 시간 척도에서 질문 의존적 시각적 신호를 모델링할 때 다중 수준 처리의 영향은 무엇인가?
  • RQ3다양한 척도에서 순환 다중모달 상호작용이 질문을 안내하는 시각적 표현 학습을 어떻게 향상시키는가?
  • RQ4다중 수준 특징에 대한 병렬 추론이 다양한 질문 유형에서 VQA 성능을 어떻게 향상시키는가?
  • RQ5계층적 시각적 추론 맥락에서 다중 척도 샘플링에 최적의 시간 척도 수는 얼마인가?

주요 결과

  • MHN 모델은 TGIF-QA에서 최신 기술 수준의 성능을 달성했으며, Action 과제에서 83.5%, Trans. 과제에서 90.8%, FrameQA 과제에서 58.1%, Count 과제에서 3.58의 정확도를 기록했다.
  • RMI에서 순환 연결을 제거하면 모든 과제에서 성능이 떨어지며, 이는 다중 수준 상호작용이 특징 정밀도 향상에 필수적임을 보여준다.
  • PVR에서 최종 블록 출력만 사용할 경우 모든 수준의 출력을 사용할 때보다 성능이 떨어지며, 이는 다중 수준 추론의 가치를 확인한다.
  • 스케일 수를 N=2에서 N=4로 늘리면 FrameQA 및 Count 과제에서 성능 향상이 나타나며, TGIF-QA에서 최적 성능은 N=3일 때 관찰되었다.
  • 각 수준마다 별도의 트랜스포머 인코더를 사용하는 변형은 성능을 약간 향상시키지만 파rameter 수를 22.8M로 증가시키며, 기본 공유 인코더 모델(16.5M)은 PSAC 및 HME와 같은 더 큰 모델을 능가하는 성능을 기록했다.
  • 제거 실험 결과는 다중 척도 시각 정보와 다중 수준 처리가 강력한 VQA 성능을 확보하는 데 핵심적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.