Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised pre-training and contrastive representation learning for multiple-choice video QA

Seonhoon Kim, Seohyeong Jeong|arXiv (Cornell University)|2020. 09. 17.
Multimodal Machine Learning Applications참고 문헌 33인용 수 5
한 줄 요약

이 논문은 다중 선택형 영상 질의응답을 위한 자기지도 학습 사전 훈련 및 대비 표현 학습 프레임워크를 제안한다. 사전 훈련 기간 동안 정답 예측을 질문 검색으로 재구성하고, 정답을 양성 샘플로, 나머지를 음성 샘플로 간주하는 감독형 대비 손실을 적용함으로써, TVQA, TVQA+, DramaQA에서 최신 기준 성능을 달성하였다. 국소적으로 정렬된 어텐션과 보조 훈련 신호를 사용하여 TVQA+ 검증 세트에서 75.83%의 정확도를 기록하였다.

ABSTRACT

Video Question Answering (Video QA) requires fine-grained understanding of both video and language modalities to answer the given questions. In this paper, we propose novel training schemes for multiple-choice video question answering with a self-supervised pre-training stage and a supervised contrastive learning in the main stage as an auxiliary learning. In the self-supervised pre-training stage, we transform the original problem format of predicting the correct answer into the one that predicts the relevant question to provide a model with broader contextual inputs without any further dataset or annotation. For contrastive learning in the main stage, we add a masking noise to the input corresponding to the ground-truth answer, and consider the original input of the ground-truth answer as a positive sample, while treating the rest as negative samples. By mapping the positive sample closer to the masked input, we show that the model performance is improved. We further employ locally aligned attention to focus more effectively on the video frames that are particularly relevant to the given corresponding subtitle sentences. We evaluate our proposed model on highly competitive benchmark datasets related to multiple-choice video QA: TVQA, TVQA+, and DramaQA. Experimental results show that our model achieves state-of-the-art performance on all datasets. We also validate our approaches through further analyses.

연구 동기 및 목표

  • 새로운 훈련 체계를 통해 모델 초기화 및 표현 학습을 향상시켜 다중 선택형 영상 질의응답 성능을 향상시키는 것.
  • 추가 애너테이션이나 데이터가 필요 없이 세분화된 영상 및 언어 이해 도전 과제를 해결하는 것.
  • 자기지도 학습 사전 훈련과 대비 학습이 영상 질의응답 벤치마크 성능 향상에 어떻게 통합 적용될 수 있는지 탐색하는 것.
  • 국소적으로 정렬된 어텐션 기법이 보다 나은 추론을 위해 자막과 관련 영상 프레임을 정렬하는 데 얼마나 효과적인지 조사하는 것.
  • 보조 손실(대비 학습 및 스팬 예측)이 모델 일반화 및 정확도에 미치는 영향을 검증하는 것.

제안 방법

  • 자기지도 학습 사전 훈련 기간 동안 영상 질의응답 작업을 영상 및 자막 컨텍스트에서 정확한 질문을 예측하는 것으로 재구성함으로써, 추가 애너테이션 없이도 더 넓은 맥락 학습이 가능하도록 한다.
  • 주 훈련 단계에서 감독형 대비 학습 손실을 적용하며, 정답은 양성 샘플로, 다른 선택지는 음성 샘플로 간주한다.
  • 대비 학습 기간 동안 정답에 대한 입력을 마스킹하고, 원본 입력을 양성 앵커로 사용하여 표현 정렬을 장려한다.
  • 자막 문장과 시간적으로 인접한 영상 프레임 간의 어텐션 점수를 계산하는 국소적으로 정렬된 어텐션 메커니즘을 도입하여 다중 모odal 정렬을 향상시킨다.
  • 주 QA 손실 외에 보조 손실인 대비 손실과 선택적 스팬 손실을 포함한 다중 작업 학습 설정을 활용한다.
  • 사전 훈련된 시각적 특징(ResNet-101)과 객체 검출(Faster R-CNN), BERT 기반 텍스트 인코더를 사용하여 영상-언어 표현 학습을 공동으로 수행한다.

실험 결과

연구 질문

  • RQ1자기지도 학습 사전 훈련 기간 동안 정답 예측을 질문 검색으로 변환하는 것이 모델 초기화 및 후속 성능 향상에 기여하는가?
  • RQ2정답과 다른 선택지를 양성 및 음성 샘플로 분리하는 감독형 대비 손실을 적용함으로써 다중 선택형 영상 질의응답에서 추론 성능이 향상되는가?
  • RQ3국소적으로 정렬된 어텐션과 전역적으로 정렬된 어텐션은 자막과 관련 영상 프레임을 정렬하는 데 어떻게 비교되는가?
  • RQ4보조 손실(대비 학습 및 스팬)이 영상 질의응답 벤치마크 성능 향상에 얼마나 기여하는가?
  • RQ5대비 손실을 적용할 경우 표현 공간이 훈련 과정에서 어떻게 변화하는가? 특히 양성-음성 표현 간 거리 분리 측면에서 어떻게 변화하는가?

주요 결과

  • 제안된 모델은 TVQA+ 검증 세트에서 최신 기준 성능인 75.83%의 정확도를 달성하였다.
  • 마스킹된 입력을 사용한 대비 학습은 정확도를 74.54%에서 75.16%로 높여 효과를 입증하였다.
  • 국소적으로 정렬된 어텐션을 사용한 모델는 전역적으로 정렬된 어텐션을 사용한 모델보다 성능이 뛰어나, 더 나은 다중 모달 정렬과 관련 없는 프레임-자막 쌍에 의한 노이즈 감소를 확인하였다.
  • 대비 손실은 훈련 과정에서 양성 표현과 가장 가까운 음성 표현 간 거리가 증가하는 것으로 측정되어 더 나은 표현 분리가 이루어졌음을 확인하였다.
  • 정성적 분석 결과, 모델은 관련 영상 스펙트럼을 정확히 국소화하고 언어적 단서(예: 'moving out'이 'officially no longer be roommates'와 일치)를 올바르게 연결하는 것으로 나타났다. 반면 기준 모델는 'door'과 같은 부적절한 키워드에 주의를 기울여 실패하였다.
  • 자기지도 학습 사전 훈련 후에 대비 미세조정을 수행하는 것이 가장 뛰어난 성능을 내어, 두 단계가 상호 보완적인 이점을 가짐을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.