[논문 리뷰] When are Lemons Purple? The Concept Association Bias of Vision-Language Models
이 논문은 CLIP, 시각-언어 모델에서 다수의 개념적으로 연결된 물체(예: 레몬과 오이차)가 동시에 존재할 경우 잘못된 속성(예: '보라')을 연결하는 개념 연관성 편향(CAB)을 규명하고 분석한다. 이 편향은 CLIP이 강한 교차 모odal 연관성에 기반해 누락된 개념을 보완함으로써, 세분화된 작업(예: VQA)의 zero-shot 성능을 떨어뜨린다. 주요 기여는 CAB가 VQA 성능을 예측할 수 있으며, 모odal 상호작용을 향상시키기 위해 미세조정된 Transformer 헤드를 추가함으로써 이를 완화할 수 있음을 보여주는 것이다.
Large-scale vision-language models such as CLIP have shown impressive performance on zero-shot image classification and image-to-text retrieval. However, such performance does not realize in tasks that require a finer-grained correspondence between vision and language, such as Visual Question Answering (VQA). As a potential cause of the difficulty of applying these models to VQA and similar tasks, we report an interesting phenomenon of vision-language models, which we call the Concept Association Bias (CAB). We find that models with CAB tend to treat input as a bag of concepts and attempt to fill in the other missing concept crossmodally, leading to an unexpected zero-shot prediction. We demonstrate CAB by showing that CLIP's zero-shot classification performance greatly suffers when there is a strong concept association between an object (e.g. eggplant) and an attribute (e.g. color purple). We also show that the strength of CAB predicts the performance on VQA. We observe that CAB is prevalent in vision-language models trained with contrastive losses, even when autoregressive losses are jointly employed. However, a model that solely relies on autoregressive loss seems to exhibit minimal or no signs of CAB.
연구 동기 및 목표
- CLIP가 검색 및 분류 작업에서 강력한 zero-shot 성능을 보임에도 불구하고 세분화된 시각-언어 작업(VQA 등)에서 성능이 떨어지는 이유를 탐구하는 것.
- CLIP 내에 존재하는 새로운 편향인 개념 연관성 편향(CAB)을 규명하고 특성화하는 것 — 이는 물체와 속성 간 강한 교차 모달 연관성에 기반해 다른 물체의 속성을 누락된 대상에 대해 예측하는 경향이 있음.
- CAB가 VQA 및 CLIPScore와 같은 후행 작업에 미치는 영향을 평가하여 평가 지표에서의 예상치 못한 취약성을 드러내는 것.
- 강화된 모달 상호작용을 통해 CAB를 완화함으로써 VQA 성능 향상이 가능함을 보여주는 것.
- 다양한 CLIP 변종 간 CAB 심각도와 VQA 정확도 사이의 정량적 연관성을 확립하는 것.
제안 방법
- 저자는 제어된 물체-속성 동시 존재 조건 하에서 CLIP의 속성 예측 행동을 탐색하기 위해 zero-shot 이미지 분류 및 VQA 스타일 프롬프팅 작업을 설계한다.
- 편향의 정도를 측정하기 위해 CAB 점수를 도입하며, 이는 목표 물체에 대해 프롬프트를 받았을 때 다른 물체와 관련된 속성을 예측하는 빈도를 측정한다.
- 더 깊은 교차 모달 상호작용을 가능하게 하기 위해 CLIP에 추가적인 Transformer 레이어를 미세조정함으로써 CLIP을 미세조정한다.
- VQA-v2에서 성능을 평가하고, 다양한 모델 변종 간 CAB 점수와 VQA 정확도 간 상관관계를 분석한다.
- 공간 풀링(예: 이미지의 왼쪽 반)을 사용한 추론 실험을 통해 CLIP이 국소화된, 물체 중심의 표현을 학습하는지 평가한다.
- 다양한 풀링 전략 간 성능 비교를 위해 NCD(가장 가까운 클래스 평균) 및 UNCD(비정규화된 NCD)를 zero-shot 분류에 사용한다.
실험 결과
연구 질문
- RQ1CLIP가 검색 및 분류 작업에서 강력한 zero-shot 성능을 보임에도 불구하고 세분화된 시각-언어 작업(VQA 등)에서 일반화에 실패하는 이유는 무엇인가?
- RQ2CLIP는 한 물체에 대해 프롬프트를 받았을 때 다른 물체의 속성을 연관지키는 편향을 보이는가?
- RQ3물체-속성 연관성 강도(예: 레몬-노란색 대비 오이차-보라)가 CLIP의 예측 행동에 어떤 영향을 미치는가?
- RQ4미세조정된 Transformer 헤드를 추가하면 개념 연관성 편향을 줄이고 VQA 성능을 향상시킬 수 있는가?
- RQ5CAB 심각도와 후행 VQA 성능 사이에 정량적 관계가 존재하는가?
주요 결과
- 이미지에 레몬과 오이차가 동시에 존재할 경우, CLIP는 레몬의 색상으로 '보라'를 높은 신뢰도로 예측함으로써 강력한 개념 연관성 편향을 보임.
- 미세조정된 CLIP 변종의 CAB 점수는 냉각된 CLIP(0.424)에 비해 유의미하게 낮아(0.330) 미세조정 후 편향 감소를 확인함.
- 미세조정된 CLIP 모델의 VQA-v2 정확도는 냉각된 CLIP의 0.390에 비해 상당히 높은 0.542를 기록함으로써 편향 완화 후 성능 향상을 입증함.
- CAB 점수와 VQA-v2 정확도 사이에 강한 음의 상관관계 존재: CAB 점수가 낮을수록 VQA 성능이 뛰어남(그림 16 참조).
- 이미지 특징의 공간 풀링(예: 이미지의 왼쪽 반)은 전역 풀링(0.417)에 비해 낮은 정확도(0.209)를 보이며, CLIP가 국소화된, 물체 중심의 표현을 학습하지 못하고 있음을 시사함.
- CLIPScore 지표는 CAB로 인해 취약한 것으로 밝혀졌으며, 강력한 개념 연관성에 의해 속임을 당할 수 있어 평가의 신뢰성에 우려를 제기함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.