Skip to main content
QUICK REVIEW

[논문 리뷰] CMA-CLIP: Cross-Modality Attention CLIP for Image-Text Classification

Huidong Liu, Shaoyuan Xu|arXiv (Cornell University)|2021. 12. 07.
Multimodal Machine Learning Applications인용 수 9
한 줄 요약

CMA-CLIP는 이미지-텍스트 분류 성능을 향상시키기 위해 순서 기반 및 모odal 기반 교차 모odal 주의 메커니즘을 통합한 통합 프레임워크를 제안한다. 미세한 피처 토큰 간 관계를 모델링하고 관련성에 따라 모달리티를 동적으로 가중함으로써, MRWPA 데이터셋에서 90% 정밀도일 때 재현율이 11.9% 향상되었고, Fashion-Gen에서 SOTA보다 5.5% 높은 정확도를 달성하였다. 또한 노이즈가 있는 입력에 대해 뛰어난 내성성을 보였다.

ABSTRACT

Modern Web systems such as social media and e-commerce contain rich contents expressed in images and text. Leveraging information from multi-modalities can improve the performance of machine learning tasks such as classification and recommendation. In this paper, we propose the Cross-Modality Attention Contrastive Language-Image Pre-training (CMA-CLIP), a new framework which unifies two types of cross-modality attentions, sequence-wise attention and modality-wise attention, to effectively fuse information from image and text pairs. The sequence-wise attention enables the framework to capture the fine-grained relationship between image patches and text tokens, while the modality-wise attention weighs each modality by its relevance to the downstream tasks. In addition, by adding task specific modality-wise attentions and multilayer perceptrons, our proposed framework is capable of performing multi-task classification with multi-modalities. We conduct experiments on a Major Retail Website Product Attribute (MRWPA) dataset and two public datasets, Food101 and Fashion-Gen. The results show that CMA-CLIP outperforms the pre-trained and fine-tuned CLIP by an average of 11.9% in recall at the same level of precision on the MRWPA dataset for multi-task classification. It also surpasses the state-of-the-art method on Fashion-Gen Dataset by 5.5% in accuracy and achieves competitive performance on Food101 Dataset. Through detailed ablation studies, we further demonstrate the effectiveness of both cross-modality attention modules and our method's robustness against noise in image and text inputs, which is a common challenge in practice.

연구 동기 및 목표

  • 분류 작업을 위한 미세조정 과정에서 CLIP이 미세한 이미지-텍스트 관계를 모델링하는 데 한계를 보이는 문제를 해결하기 위해.
  • 이미지 또는 텍스트 입력에 노이즈가 있을 경우에도 관련성 가중치를 학습하여 내성성을 향상시키기 위해.
  • 작업별 모달리티 주의 및 MLP 헤드를 갖춘 단일 통합 네트워크를 통해 다중 작업 분류를 가능하게 하기 위해.
  • 학습 및 추론 과정에서 양 모달리티를 활용하여 CLIP의 다운스트림 분류 성능을 zero-shot 능력 이상으로 향상시키기 위해.

제안 방법

  • 이미지 패치와 텍스트 토큰 간의 미세한 상관관계를 트랜스포머 기반 메커니즘을 사용해 모델링하는 순서 기반 주의 모듈을 통합한다.
  • 분류 작업에 대한 관련성에 따라 이미지 및 텍스트 모달리티의 동적 가중치를 학습하는 모달리티 기반 주의 모듈을 적용한다.
  • 다중 작업 학습을 지원하기 위해 CLIP 기반 네트워크에 작업별 모달리티 기반 주의 헤드와 다층퍼셉트론(Multilayer Perceptrons, MLPs)을 추가한다.
  • 이미지-텍스트 쌍에 대해 대비 손실을 사용하여 모델을 훈련하고, 전체 아키텍처의 엔드 투 엔드 최적화를 수행한다.
  • 주의 시각화를 통해 모델이 관련 있는 이미지 패치와 텍스트 토큰에 집중하는지 해석하고 검증한다.

실험 결과

연구 질문

  • RQ1이미지 패치와 텍스트 토큰 간의 미세한 교차 모달 관계를 모델링하면 표준 CLIP을 초월한 분류 성능 향상이 가능한가?
  • RQ2모달리티별 주의 가중치를 학습하면 노이즈가 있거나 관련성이 없는 이미지 또는 텍스트 입력에 대해 성능이 향상되는가?
  • RQ3공유된 표현을 사용하는 단일 통합 네트워크 아키텍처가 효과적으로 다중 작업 이미지-텍스트 분류를 지원할 수 있는가?
  • RQ4실제 세계 및 공개 벤치마크에서 CMA-CLIP는 정확도 및 내성성 측면에서 SOTA 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • MRWPA 데이터셋에서 CMA-CLIP는 세 가지 제품 속성 분류 작업 전반에서 미세조정된 CLIP와 동일한 정밀도(90%) 수준에서 평균 재현율이 11.9% 향상되었다.
  • Fashion-Gen 데이터셋에서 CMA-CLIP는 93.6%의 정확도를 기록하여 이전 SOTA 방법(KaleidoBERT)을 5.5%포인트 뛰어넘었다.
  • 제거 실험 결과, 모달리티 기반 주의 모듈을 제거하면 MRWPA의 평균 재현율이 53.4%에서 47.5%로 감소하여 노이즈 입력을 걸러내는 데서의 기여도를 확인하였다.
  • 순서 기반 주의 모듈의 기여도도 뚜렷하였으며, 이를 제거하면 재현율이 47.5%에서 45.8%로 추가로 감소하였다.
  • 시각화 결과, 순서 기반 주의 모듈이 세 데이터셋 전반에서 분류에 관련된 텍스트 토큰과 관련된 이미지 패치를 정확히 식별하고 있음을 확인하였다.
  • Food101에서 CMA-CLIP는 93.1%의 정확도를 기록하여 MMBT 및 BERT와 같은 강력한 베이스라인을 능가하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.