[논문 리뷰] Exposing and Mitigating Spurious Correlations for Cross-Modal Retrieval
이 논문은 훈련 데이터에서 의미적으로 관련이 없는 물체들이 빈번하게 함께 나타나는 것에 의해 발생하는 이미지-텍스트 검색 모델의 허위 상관관계를 측정하고 완화하기 위한 새로운 지표인 ODmAP@k를 제안한다. 이미지에서 물체를 제거하는 인painting 기법과 텍스트 재구성 기법을 활용해 합성된 데이터로 미세조정함으로써, 표준 검색 성능을 유지하면서도 허위 상관관계에 대한 강건성을 크게 향상시켰으며, MSCOCO와 Flickr30k에서 세 개의 SOTA 모델을 대상으로 검증되었다.
Cross-modal retrieval methods are the preferred tool to search databases for the text that best matches a query image and vice versa. However, image-text retrieval models commonly learn to memorize spurious correlations in the training data, such as frequent object co-occurrence, instead of looking at the actual underlying reasons for the prediction in the image. For image-text retrieval, this manifests in retrieved sentences that mention objects that are not present in the query image. In this work, we introduce ODmAP@k, an object decorrelation metric that measures a model's robustness to spurious correlations in the training data. We use automatic image and text manipulations to control the presence of such object correlations in designated test data. Additionally, our data synthesis technique is used to tackle model biases due to spurious correlations of semantically unrelated objects in the training data. We apply our proposed pipeline, which involves the finetuning of image-text retrieval frameworks on carefully designed synthetic data, to three state-of-the-art models for image-text retrieval. This results in significant improvements for all three models, both in terms of the standard retrieval performance and in terms of our object decorrelation metric. The code is available at https://github.com/ExplainableML/Spurious_CM_Retrieval.
연구 동기 및 목표
- 허위 상관관계(예: 관련 없는 물체들이 자주 함께 나타나는 것 등)가 이미지-텍스트 검색 모델에 미치는 영향을 특정하고 정량화하는 것.
- 쿼리 이미지에 포함된 물체가 포함된 텍스트를 검색하는지 여부를 평가하고, 원본 이미지에서 제거된 물체를 배제함으로써 이러한 허위 상관관계에 대한 모델의 강건성을 측정하는 새로운 평가 지표인 ODmAP@k를 개발하는 것.
- 훈련 데이터에서 빈번한 물체의 동시출현을 제거함으로써 모델의 편향을 줄이기 위한 합성 이미지-텍스트 쌍 생성을 위한 데이터 증강 파이프라인을 설계하는 것.
- 합성 데이터로 미세조정함으로써 새로운 지표에서의 모델 강건성이 향상되면서도 표준 검색 성능이 유지되거나 향상됨을 보여주는 것.
제안 방법
- 쿼리 이미지에 포함된 물체가 포함되어 있고, 원본 이미지에서 제거된 물체는 배제된 텍스트가 검색되는지 평가하는 ODmAP@k 지표를 제안한다.
- 물체 검출 및 이미지 인painting을 사용하여 실제 이미지에서 자주 함께 나타나는 물체를 제거함으로써 합성 쿼리 이미지를 생성한다.
- 명사구 제거 또는 텍스트 생성 모델을 활용해 해당 이미지에 대응하는 텍스트 설명을 생성함으로써 합성된 이미지-텍스트 데이터 쌍을 만든다.
- 기존 데이터와 합성 데이터의 조합을 사용한 미세조정 파이프라인을 적용하여 이미지-텍스트 검색 모델의 편향을 줄인다.
- 다양한 이미지 합성 전략(예: 흐림, 0 패딩, 평균 패딩, 인painting)과 텍스트 생성 방법(예: 프롬프트, 캡션 모델)을 비교하여 효과성을 평가한다.
- 표준 벤치마크(MSCOCO, Flickr30k)와 새로운 지표를 사용하여 세 개의 SOTA 이미지-텍스트 검색 모델(예: CLIP)을 훈련하고 평가한다.
실험 결과
연구 질문
- RQ1기존의 이미지-텍스트 검색 모델이 실제 이미지 콘텐츠보다는 의미적으로 관련이 없는 물체들이 자주 함께 나타나는 것 같은 허위 상관관계에 얼마나 의존하고 있는가?
- RQ2이러한 허위 상관관계에 대한 모델의 강건성을 특별히 측정할 수 있는 평가 지표를 어떻게 설계할 수 있는가?
- RQ3이미지 및 텍스트의 합성 데이터 생성 전략 중에서 허위 물체 동시출현의 기억을 가장 효과적으로 줄이는 것은 무엇인가?
- RQ4합성 데이터로 미세조정함으로써 새로운 지표에서의 모델 강건성이 향상되면서도 표준 검색 성능이 떨어지지 않는가?
주요 결과
- 합성 데이터를 생성하는 데로드된 명사구 제거와 인painting을 사용한 미세조정으로 CLIP의 ODmAP@1이 59.8에서 70.1로 향상되어 허위 상관관계가 강력하게 완화됨을 확인하였다.
- 가장 높은 성능을 보인 합성 데이터 생성 전략은 텍스트에 대해 명사구 제거, 이미지에 대해 인painting을 사용한 것으로, ODmAP@1이 70.1을 기록하였다. 반면 프롬프트 기반 텍스트 생성은 허브니스 문제를 유발하여 k 값이 높을수록 성능이 떨어졌다.
- 약 10%의 합성 데이터(1장의 이미지당 1개의 캡션)로도 ODmAP@1에서 최대 근접 성능 향상을 달성하였으며, 20%를 초과하면 성능 향상이 포화 상태에 이르렀다.
- 다양한 비율의 합성 데이터를 사용한 결과, 표준 검색 성능(R@1)은 변화가 없었으며, 주요 작업 성능에 영향을 주지 않았다.
- 세 개의 SOTA 모델에 대해 이 방법이 강건성을 크게 향상시켜, 단일 아키텍처를 넘어서 일반화 가능성을 입증하였다.
- 분포 외 이미지 기법(예: 0 패딩)을 사용해 생성한 합성 데이터는 성능을 떨어뜨렸으며, 이는 분포 이탈이 새로운 편향을 유도할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.