Skip to main content
QUICK REVIEW

[논문 리뷰] Multimodal Fusion Refiner Networks

Sethuraman Sankaran, David Y. Yang|arXiv (Cornell University)|2021. 04. 08.
Anomaly Detection Techniques and Applications참고 문헌 54인용 수 9
한 줄 요약

이 논문은 잠재 공간에서 단모달 및 다모달 표현을 균형 있게 유지하기 위해 책임 조건을 도입함으로써 다모달 융합을 향상시키는 모oduular 프레임워크인 Refiner Fusion Network(ReFNet)을 제안한다. Refiner 모듈과 융합 네트워크, 대조 학습을 결합함으로써 ReFNet은 후행 작업에서 성능을 향상시키고, 잠재 공간에서의 클러스터링을 향상시키며, 제한된 레이블 데이터 조건에서도 높은 정확도를 유지한다.

ABSTRACT

Tasks that rely on multi-modal information typically include a fusion module that combines information from different modalities. In this work, we develop a Refiner Fusion Network (ReFNet) that enables fusion modules to combine strong unimodal representation with strong multimodal representations. ReFNet combines the fusion network with a decoding/defusing module, which imposes a modality-centric responsibility condition. This approach addresses a big gap in existing multimodal fusion frameworks by ensuring that both unimodal and fused representations are strongly encoded in the latent fusion space. We demonstrate that the Refiner Fusion Network can improve upon performance of powerful baseline fusion modules such as multimodal transformers. The refiner network enables inducing graphical representations of the fused embeddings in the latent space, which we prove under certain conditions and is supported by strong empirical results in the numerical experiments. These graph structures are further strengthened by combining the ReFNet with a Multi-Similarity contrastive loss function. The modular nature of Refiner Fusion Network lends itself to be combined with different fusion architectures easily, and in addition, the refiner step can be applied for pre-training on unlabeled datasets, thus leveraging unsupervised data towards improving performance. We demonstrate the power of Refiner Fusion Networks on three datasets, and further show that they can maintain performance with only a small fraction of labeled data.

연구 동기 및 목표

  • 기존의 다모달 융합 프레임워크가 다모달 표현을 우선시하면서 강력한 단모달 신호를 충분히 활용하지 못하는 한계를 해결하기 위해.
  • 책임 조건을 도입함으로써 융합 모듈의 정규화를 유도하고 기울기 소실을 방지함으로써 융합 표현 품질을 향상시키기 위해.
  • Refiner 모듈을 통해 융합된 임베딩 공간에 잠재적인 그래픽 구조를 유도하기 위해.
  • Refiner 모듈을 통한 자기지도 학습을 활용하여 최소한의 레이블 데이터로도 성능을 향상시키기 위해.
  • Refiner 모듈을 거리 학습과 결합하여 다모달 작업에서의 클러스터링 및 표현 학습 품질을 향상시키기 위해.

제안 방법

  • ReFNet 아키텍처는 융합 모듈과 Refiner 모듈을 통합하며, Refiner 모듈은 융합된 특징을 모odal별 표현으로 복원하여 원본 및 복원된 특징 간 코사인 유사도 손실을 통해 책임 조건을 강제한다.
  • 책임 조건은 학습 중 단모달 및 다모달 뉴런의 균형 잡힌 학습을 촉진하는 정규화 요소로 작용한다.
  • Refiner 모듈은 융합 후 적용되며, ViLBERT와 같은 다모달 트랜스포머를 포함한 기존의 모든 융합 아키텍처와 통합 가능하다.
  • 다중 유사도 대조 손실(Multi-Similarity contrastive loss)이 적용되어 샘플 간 및 모달 간 잠재적 그래픽 구조를 강화함으로써 임베딩 공간 내의 클러스터링을 향상시킨다.
  • Refiner 모듈은 레이블이 없는 데이터에서의 사전 훈련을 가능하게 하여, 비지도 데이터를 활용해 후행 작업의 성능을 향상시킬 수 있다.
  • T-SNE 시각화를 통해 잠재 공간 내에서 융합된 임베딩의 개선된 클러스터링을 분석하고 검증한다.

실험 결과

연구 질문

  • RQ1책임 기반 Refiner 모듈은 ViLBERT와 같은 강력한 베이스라인 모델을 초월하여 다모달 융합 성능을 향상시킬 수 있는가?
  • RQ2Refiner 모듈은 융합된 임베딩 공간에 의미 있는 잠재적 그래픽 구조를 유도하는가? 그리고 특정 조건 하에서 이를 입증할 수 있는가?
  • RQ3Refiner 모듈을 거리 학습(Multi-Similarity 손실 등)과 조합할 경우 표현 품질과 후행 작업 성능에 어떤 영향을 미치는가?
  • RQ4소수의 레이블 데이터만 존재할 경우 ReFNet은 어느 정도의 성능 유지를 유지할 수 있는가?
  • RQ5한 모달이 융합 과정에서 지배적일 경우 Refiner 모듈은 기울기 소실을 완화하고 학습을 향상시키는가?

주요 결과

  • Hateful Meme 데이터셋에서 ReFNet은 ViLBERT 베이스라인 대비 상대적 정확도 향상 5.53% 이상, AUC 향상 1.84%를 기록했다.
  • MM-IMDB 데이터셋에서 레이블 데이터의 5%만 사용했을 경우 ReFNet은 마이크로-F1을 4.05점, 마크로-F1을 13.77점 향상시켰으며, 거리 학습과 조합된 ReFNet MS에서는 추가적인 성능 향상이 있었다.
  • T-SNE 시각화 결과 ReFNet은 ViLBERT보다 더 잘 분리된 클러스터를 생성했으며, ReFNet MS는 시각 및 언어 모달 각각 3개의 클래스에 해당하는 6개의 명확한 클러스터를 달성했다.
  • Refiner 모듈은 임베딩 공간에 강력한 잠재적 그래픽 구조를 유도하였으며, 특정 조건 하에서 분석적으로 지지되고 클러스터링을 통한 실증적 검증을 통과했다.
  • ReFNet은 데이터 부족 상황에서도 높은 성능을 유지하여 자동 레이블링 비용을 줄이는 데 유의미한 기여를 하였다.
  • 한 모달이 지배적일 경우 Refiner 모듈이 기울기 소실을 완화하고 표현 학습을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.