Skip to main content
QUICK REVIEW

[논문 리뷰] Attention Bottlenecks for Multimodal Fusion

Arsha Nagrani, Shan Yang|arXiv (Cornell University)|2021. 06. 30.
Music and Audio Processing참고 문헌 62인용 수 264
한 줄 요약

본 논문은 MBT(Multimodal Bottleneck Transformer)를 도입하여 병목 토큰을 통한 교차 모달 융합을 제한하고, 계산량을 줄이면서 오디오-비주얼 비디오 분류 성능을 향상시키며 AudioSet, Epic-Kitchens100, VGGSound에서 최첨단 성능을 달성한다.

ABSTRACT

Humans perceive the world by concurrently processing and fusing high-dimensional inputs from multiple modalities such as vision and audio. Machine perception models, in stark contrast, are typically modality-specific and optimised for unimodal benchmarks, and hence late-stage fusion of final representations or predictions from each modality (`late-fusion') is still a dominant paradigm for multimodal video classification. Instead, we introduce a novel transformer based architecture that uses `fusion bottlenecks' for modality fusion at multiple layers. Compared to traditional pairwise self-attention, our model forces information between different modalities to pass through a small number of bottleneck latents, requiring the model to collate and condense the most relevant information in each modality and only share what is necessary. We find that such a strategy improves fusion performance, at the same time reducing computational cost. We conduct thorough ablation studies, and achieve state-of-the-art results on multiple audio-visual classification benchmarks including Audioset, Epic-Kitchens and VGGSound. All code and models will be released.

연구 동기 및 목표

  • 구조화된 병목을 통해 교차 모달 상호작용을 가능하게 하여 늦은 융합을 넘어서 멀티모달 융합을 촉진한다.
  • 융합 병목을 통해 교차 모달 정보 흐름을 제약하여 제곱 주의 비용을 줄이기 위해 MBT를 제안한다.
  • 표준 오디오-비주얼 비디오 벤치마크에서 MBT를 평가하고 최첨단 방법들과 비교한다.
  • 성능과 효율성에 대한 융합 계층 위치(초기/중간/후기) 및 병목 크기의 영향을 분석한다.

제안 방법

  • 오디오 및 비주얼 입력을 패치로 표현하고, 별도의 모달리티 토큰을 사용해 변환기 토큰에 임베딩한다.
  • 각 계층 내에서 소수의 잠재 단위로 교차 모달 정보를 통과시키도록 하는 융합 병목 토큰을 도입한다.
  • 바닐라 셀프 어텐션, 모달별 매개변수를 사용하는 교차 어텐션, 또는 병목 기반 교차 모달 어텐션 중 하나를 허용하며, 병목은 계층 내 교차 모달 흐름을 제한한다.
  • 초기 또는 후기 융합 대신 중간 융합(나중 계층에서의 융합)을 실험하여 단일 모달 특징 학습과 교차 모달 상호 작용의 균형을 맞춘다.
  • ViT 유사 백본을 사용하여 AudioSet, Epic-Kitchens-100, VGGSound에 대해 학습 및 평가하며, 데이터 증강 및 모달리티 MixUp을 적용한다.

실험 결과

연구 질문

  • RQ1교차 모달 주의(attention)를 작은 병목으로 제한하는 것이 성능을 희생하지 않으면서 멀티모달 융합의 효율성을 향상시킬 수 있는가?
  • RQ2병목이 있는 중간 융합이 초기 또는 후기 융합보다 오디오-비주얼 비디오 벤치마크에서 더 나은 성능을 보여주는가?
  • RQ3병목 크기와 융합 계층 배치가 정확도와 계산량에 미치는 영향은 무엇인가?
  • RQ4모달리티별 가중치와 입력 샘플링 전략이 멀티모달 융합 성능에 영향을 미치는가?

주요 결과

  • 병목 융합을 갖춘 MBT가 제한되지 않은 교차 모달 융합보다 계산 비용을 줄이면서도 성능을 상회한다.
  • 병목이 있는 중간 융합은 AudioSet, Epic-Kitchens-100, VGGSound에서 최첨단 성능을 얻는다.
  • AudioSet에서 MBT는 이전 최첨단보다 5.9 mAP를 상회(상대 12.7% 증가)한다.
  • 적은 수의 병목 토큰(B=4)은 후기 융합 대비 큰 이득을 제공하며 추가 계산은 거의 필요치 않다.
  • 주의 맵은 MBT가 오디오 이벤트와 연계된 의미적으로 관련된 영역을 국지화하는 것을 보여주며, 효과적인 교차 모달 조건화를 강조한다.
  • MBT는 다양한 클립 길이와 데이터세트 규모에서도 견고한 성능을 유지하며, 모든 데이터세트에서 단일 모달 기준치를 상회한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.