[논문 리뷰] Rethinking Multi-Modal Alignment in Video Question Answering from Feature and Sample Perspectives
이 논문은 비디오 질의응답(VideoQA)에서 다중모달 정렬을 위한 새로운 접근법을 제안한다. 비디오 궤적 특징과 샘플 수준의 데이터 증강을 활용하며, 다중헤드 자기주의 어텐션 기반의 궤적 인코더와 이질적 그래프 아키텍처를 도입하여 궤적 수준과 프레임 수준의 시각적 특징을 언어와 정렬한다. 또한 음성 답변 및 교차 비디오 QA 쌍 증강을 통해 다중모달 대응 관계를 강화한다. 이 방법은 NExT-QA 벤치마크에서 기존의 모든 모델을 능가하는 최신 성능을 달성한다.
Reasoning about causal and temporal event relations in videos is a new destination of Video Question Answering (VideoQA).The major stumbling block to achieve this purpose is the semantic gap between language and video since they are at different levels of abstraction. Existing efforts mainly focus on designing sophisticated architectures while utilizing frame- or object-level visual representations. In this paper, we reconsider the multi-modal alignment problem in VideoQA from feature and sample perspectives to achieve better performance. From the view of feature,we break down the video into trajectories and first leverage trajectory feature in VideoQA to enhance the alignment between two modalities. Moreover, we adopt a heterogeneous graph architecture and design a hierarchical framework to align both trajectory-level and frame-level visual feature with language feature. In addition, we found that VideoQA models are largely dependent on language priors and always neglect visual-language interactions. Thus, two effective yet portable training augmentation strategies are designed to strengthen the cross-modal correspondence ability of our model from the view of sample. Extensive results show that our method outperforms all the state-of-the-art models on the challenging NExT-QA benchmark, which demonstrates the effectiveness of the proposed method.
연구 동기 및 목표
- 비디오 질의응답에서 언어와 비디오 간의 의미적 격차를 해소하기 위해 특징 및 샘플 차원에서의 다중모달 정렬을 향상시키기.
- 객체 수준의 표현이 비디오의 시계적 및 인과적 관계를 포착하는 데 한계가 있음을 극복하기.
- 강력한 훈련 데이터 증강 전략을 도입하여 모델이 언어 사전 지식에 의존하는 것을 줄이기.
- 궤적 수준의 시각적 표현과 그래프 기반 추론을 통해 다중모달 대응 관계를 향상시키기.
제안 방법
- 먼저 사전 훈련된 객체 검출기와 향상된 순차적 NMS를 사용하여 비디오 궤적을 추출한다.
- 시간적 및 의미적 임bedding을 갖춘 다중헤드 자기주의 어텐션 기반 궤적 인코더로 궤적 내 장거리 의존성을 모델링한다.
- 사이클 어텐션 모듈이 궤적 수준과 프레임 수준의 시각적 특징을 언어 특징과 정렬한다.
- 다양한 시각적 및 언어적 요소 간의 암묵적 관계를 모델링하기 위해 이질적 그래프 네트워크를 설계한다.
- 두 가지 샘플 수준의 증강 전략을 도입한다: (1) 매칭 과정에서 음성 답변을 샘플링하고, (2) 다른 비디오에서의 음성 질문-답변 쌍을 사용한다.
- 모델은 GloVe 및 미세조정된 BERT 임베딩을 모두 사용하여 다중 선택 NExT-QA 벤치마크에서 엔드 투 엔드로 훈련된다.
실험 결과
연구 질문
- RQ1궤적 수준의 시각적 표현은 비디오 질의응답에서 프레임 수준 또는 객체 수준의 특징에 비해 다중모달 정렬을 어떻게 향상시키는가?
- RQ2그래프 기반 아키텍처는 비디오 이해에서 다양한 시각적 및 언어적 요소 간의 추론을 얼마나 향상시킬 수 있는가?
- RQ3샘플 수준의 데이터 증강 전략은 모델이 언어 사전 지식에 의존하는 것을 줄이고 다중모달 대응 관계를 향상시키는 데 기여하는가?
- RQ4궤적 품질과 증강 설계가 비디오 질의응답에서 인과적 및 시계적 추론 성능에 공동으로 영향을 미치는 정도는 어느 정도인가?
주요 결과
- 제안된 방법은 도전적인 NExT-QA 벤치마크에서 기존의 모든 모델을 능가하는 최신 성능을 달성한다.
- 음성 답변 샘플링과 교차 비디오 QA 쌍 증강을 모두 사용할 경우 정확도가 크게 향상되었으며, 특히 GloVe 임베딩에서 두드러졌다.
- BERT-FT의 경우, 두 번째 증강 전략(qa-), 즉 다른 비디오에서의 음성 QA 쌍을 사용하는 전략이 문장 수준의 임베딩의 한계에도 불구하고 성능 향상에 기여했다.
- 음성 샘플의 수는 15개까지 긍정적인 영향을 미쳤으며, 이후 성능이 정체되었다.
- 제거 실험 결과, 궤적 인코더나 그래프 구성 요소를 제거하면 성능이 크게 떨어져 이들의 중요성을 확인했다.
- 다중헤드 자기주의 어텐션 기반 궤적 인코더는 대부분의 경우 GRU보다 우수했으며, 특히 시계적 질문에서 효과적이었다. 이는 글로벌 상호작용을 모델링하는 데의 유용성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.