Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Multimodal Data Augmentation in Feature Space

Zichang Liu, Zhiqiang Tang|arXiv (Cornell University)|2022. 12. 29.
Multimodal Machine Learning Applications인용 수 9
한 줄 요약

LeMDA는 특징 공간에서 직접 다중모态 데이터 증강을 학습하는 새로운 종단간 방법으로, 이미지, 텍스트, 표준 데이터와 같은 다양한 모달리티를 특별한 모달리티별 설계 없이 공동으로 증강할 수 있다. 교차모달 관계를 유지하면서 일致성 있는 의미 인식 증강 정책을 학습함으로써 여러 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

The ability to jointly learn from multiple modalities, such as text, audio, and visual data, is a defining feature of intelligent systems. While there have been promising advances in designing neural networks to harness multimodal data, the enormous success of data augmentation currently remains limited to single-modality tasks like image classification. Indeed, it is particularly difficult to augment each modality while preserving the overall semantic structure of the data; for example, a caption may no longer be a good description of an image after standard augmentations have been applied, such as translation. Moreover, it is challenging to specify reasonable transformations that are not tailored to a particular modality. In this paper, we introduce LeMDA, Learning Multimodal Data Augmentation, an easy-to-use method that automatically learns to jointly augment multimodal data in feature space, with no constraints on the identities of the modalities or the relationship between modalities. We show that LeMDA can (1) profoundly improve the performance of multimodal deep learning architectures, (2) apply to combinations of modalities that have not been previously considered, and (3) achieve state-of-the-art results on a wide range of applications comprised of image, text, and tabular data.

연구 동기 및 목표

  • 다중모달 학습을 위한 효과적인 데이터 증강 기법의 부족을 해결하기 위해, 기존의 단모달 증강 기법이 모달리티 간 의미 정렬을 방해하는 문제를 해결한다.
  • 다양한 모달리티를 함께 증강함으로써 그 의미 관계와 레이블 일관성을 유지하는 일반 목적의 방법을 개발한다.
  • 이미 고려되지 않은 조합, 예를 들어 표준 데이터와 이미지 데이터와 같은 조합을 포함해 임의의 모달리티 조합에 대한 데이터 증강을 가능하게 한다.
  • 수작업으로 만든 변환에 의존하지 않고 다중모달 학습에서 모델의 일반화 능력과 강건성을 향상시킨다.

제안 방법

  • LeMDA는 다중모달 인코더의 잠재 특징 공간에서 공동 증강 정책을 학습하며, 증강된 특징을 생성하기 위해 변동형 오토인코더(VAE)를 사용한다.
  • 일관성 정규화 기법을 적용하여 원본 및 증강된 특징에 대해 동일한 예측을 하도록 모델을 유도함으로써 의미적 구조를 유지한다.
  • 일관성 손실 계산 중에 낮은 신뢰도를 가진 학습 샘플을 필터링하기 위해 신뢰도 기반 마스킹을 사용하여 학습의 안정성과 정확도를 향상시킨다.
  • 증강 네트워크에 대해 MLP-VAE와 Attention-VAE 아키텍처를 모두 지원하며, 대부분의 설정에서 MLP-VAE가 더 우수한 성능을 보인다.
  • 이 프레임워크는 모달리티에 독립적이며, 교차모달 관계(예: 보완적 또는 중복적인 모달리티)에 대한 가정이 필요하지 않다.
  • 증강은 학습 중 종단 간으로 적용되며, 대상 모델은 학습된 증강에 대해 불변이 되도록 훈련된다.

실험 결과

연구 질문

  • RQ1이미지, 텍스트, 표준 데이터와 같은 다양한 모달리티에 대해 통합적이고 학습 가능한 데이터 증강 전략이 효과적일 수 있는가?
  • RQ2특징 공간에서의 공동 증강이 개별 단모달 증강보다 모델의 일반화 능력과 정확도 측면에서 뛰어나게 되는가?
  • RQ3LeMDA는 보완적 또는 완전히 상관된 모달리티를 포함한 다양한 교차모달 관계에서 어떻게 성능을 내는가?
  • RQ4학습 기반 증강 정책이 특히 시각 외 모달리티인 표준 데이터와 같은 경우에 수작업으로 만든 모달리티별 증강 기법을 능가할 수 있는가?
  • RQ5신뢰도 마스킹 임계값과 같은 하이퍼파라미터가 일관성 정규화 기법의 성능에 크게 영향을 미치는가?

주요 결과

  • LeMDA는 이미지-텍스트(SNLI-VE 등), 표준 데이터(Wine Reviews 등), 텍스트 전용(News Channel 등) 작업을 포함한 다양한 다중모달 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • SNLI-VE 벤치마크에서 LeMDA는 정확도를 0.8836까지 향상시켜 기준 방법과 단모달 증강 기법을 뛰어넘는다.
  • α=0.5로 설정한 신뢰도 기반 마스킹은 마스킹 없이(α=0) 수행한 것보다 더 높은 종단 간 정확도를 달성하며, 다양한 α 값에 대해 성능이 뛰어나게 안정적이다.
  • 일관성 정규화 기법은 특징 공간에서의 L2 정규화보다 우수한 성능을 보이며, 이는 모델 예측을 직접 활용하여 의미 일관성을 유지하기 때문이다.
  • LeMDA는 보완적 또는 중복적인 모달리티 관계 여부에 관계없이 모든 테스트 데이터셋에서 일관되게 성능 향상을 이룬다.
  • MLP-VAE 아키텍처는 대부분의 설정에서 Attention-VAE를 능가하며, 이는 융합 레이어에서 연결된 잠재 표현을 더 잘 처리하기 때문일 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.