[논문 리뷰] Multi-modal Feature Fusion with Feature Attention for VATEX Captioning Challenge 2020
이 논문은 학습 가능한 특징 주의 메커니즘을 사용하여 운동, 외관, 의미 및 청각 특징을 융합하는 다중 모odal 비디오 캡셔닝 모델을 제안한다. 상향식 및 X-LAN 디코더를 조합하고 다단계 훈련 전략을 적용함으로써, 영어 비공개 테스트 세트에서 76.0 CIDEr, 중국어 비공개 테스트 세트에서 50.0 CIDEr를 기록하여 VATEX 캡셔닝 챌린지 2020의 두 트랙에서 모두 2위를 기록하였다.
This report describes our model for VATEX Captioning Challenge 2020. First, to gather information from multiple domains, we extract motion, appearance, semantic and audio features. Then we design a feature attention module to attend on different feature when decoding. We apply two types of decoders, top-down and X-LAN and ensemble these models to get the final result. The proposed method outperforms official baseline with a significant gap. We achieve 76.0 CIDEr and 50.0 CIDEr on English and Chinese private test set. We rank 2nd on both English and Chinese private test leaderboard.
연구 동기 및 목표
- 운동, 외관, 의미 및 청각 특징을 통합하여 비디오 캡셔닝 성능을 향상시키기 위해 다중 모달 특징을 통합한다.
- 다단계 훈련 전략을 통해 자동회귀 디코딩에서 발생하는 노출 편향 문제를 해결한다.
- 디코딩 중 다양한 모달리티에 대해 동적 주의 가중치를 학습함으로써 특징 융합을 향상시킨다.
- VATEX 캡셔닝 챌린지 2020의 영어 및 중국어 언어 트랙에서 최신 기술 수준의 성능을 달성한다.
제안 방법
- I3D와 SlowFast 3D CNN을 사용하여 운동 특징을 추출하고, PNASNet를 통해 외관 특징을 추출하며, Faster R-CNN을 통해 영역 특징을 추출하고, ECO를 사용하여 2D-3D 융합 특징을 생성한다.
- 시각적 특징에 다층 퍼셉트론을 적용하여 의미 특징을 생성하고, 예측된 속성 및 주제 확률을 프레임 전역으로 복제하여 연결한다.
- 16 kHz 오디오에서 추출한 MEL-스펙트로그램 조각을 기반으로 VGGish를 사용하여 청각 특징을 추출한다.
- 디코더의 은닉 상태를 기반으로 게이팅 메커니즘을 사용하여 다중 모달 특징에 대한 동적 가중치를 계산하는 특징 주의 모듈을 구현한다.
- 두 개의 디코더를 사용한다: 바닥에서부터의 주의를 갖는 상향식 GRU 기반 모델과 이중선형 특징 선택을 위한 X-Linear 주의를 사용하는 X-LAN 모델.
- 세 단계 훈련 파이프라인을 적용한다: 교차 엔트로피 손실, 단어 수준 오라클, 학습률 감소를 포함한 자기 비판 정책 기반 강화 학습.
실험 결과
연구 질문
- RQ1운동, 외관, 의미 및 청각 특징을 함께 모델링하면 비디오 캡셔닝 성능 향상에 기여하는가?
- RQ2디코딩 중 다중 모달 입력에 대해 동적으로 가중치를 조정하는 학습 가능한 특징 주의 메커니즘이 얼마나 효과적인가?
- RQ3앙상블 학습을 통해 상향식 및 X-LAN 디코더를 조합하면 개별 모델보다 더 나은 일반화 성능을 달성하는가?
- RQ4다단계 훈련 전략이 노출 편향을 어느 정도 완화하고 CIDEr 점수를 향상시키는가?
- RQ5제안된 방법은 언어 간 일반화 능력을 보이며 영어 및 중국어 비디오 캡셔닝 벤치마크에서 강력한 성능을 달성할 수 있는가?
주요 결과
- 앙상블 모델은 영어 비공개 테스트 세트에서 76.0 CIDEr를 기록하여 VATEX 캡셔닝 챌린지 2020 영어 트랙에서 2위를 기록하였다.
- 모델은 중국어 비공개 테스트 세트에서 50.0 CIDEr를 기록하여 중국어 트랙에서 2위를 기록하였다.
- X-LAN은 영어 및 중국어 작업의 모두 검증 세트에서 상향식 모델을 초월하는 성능을 보였다.
- 단어 수준 오라클 및 자기 비판 훈련을 포함한 다단계 훈련 전략이 CIDEr 점수 향상에 기여하였다.
- 특징 주의 모듈은 다중 모달 특징을 효과적으로 융합하여 더 나은 맥락 인식 기반의 캡셔닝 생성을 가능하게 하였다.
- 모델는 언어 간 제로샷 일반화 능력을 보이며 영어 및 중국어 테스트 세트에서 모두 높은 성능을 달성하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.