Skip to main content
QUICK REVIEW

[논문 리뷰] A Prompt Array Keeps the Bias Away: Debiasing Vision-Language Models with Adversarial Learning

Hugo Berg, Siobhan Mackenzie Hall|arXiv (Cornell University)|2022. 03. 22.
Multimodal Machine Learning Applications인용 수 11
한 줄 요약

이 논문은 이미지-텍스트 표현에서 성별 및 인종 편향을 감소시키기 위해 학습 가능한 '편향 제거' 토큰을 텍스트 쿼리에 첨부하는 프롬프트 기반 적대적 편향 제거 방법을 제안한다. 이 방법은 대조 손실과 함께 공동 최적화되어 표현 품질을 떨어뜨리지 않으면서도 여러 지표(최대스키우, NDKL)에서 편향을 크게 감소시킨다. 이는 오직 속성 레이블이 부여된 얼굴 데이터셋만을 감독으로 사용한다.

ABSTRACT

Vision-language models can encode societal biases and stereotypes, but there are challenges to measuring and mitigating these multimodal harms due to lacking measurement robustness and feature degradation. To address these challenges, we investigate bias measures and apply ranking metrics for image-text representations. We then investigate debiasing methods and show that prepending learned embeddings to text queries that are jointly trained with adversarial debiasing and a contrastive loss reduces various bias measures with minimal degradation to the image-text representation.

연구 동기 및 목표

  • 시각-언어 모델의 표현 편향을 측정하고 완화하기 위한 강건하고 효율적인 방법을 개발하기 위해.
  • 기존의 편향 측정 기법을 평가하고 다중모odal 표현에 가장 적합한 기법을 식별하기 위해.
  • 재학습이나 원본 사전학습 데이터에 접근할 수 없는 조건에서도 편향 제거 문제를 해결하기 위해.
  • 편향 제거 과정에서 이미지-텍스트 표현 품질이 저하되는 것을 최소화하기 위해.
  • 기존 사전학습 모델에 적용 가능한 경량이며 구현 가능한 편향 제거 프rotocol를 제공하기 위해.

제안 방법

  • 이미지-텍스트 유사도 점수에서 이미지 속성 레이블(예: 성별, 인종)을 예측하는 적대적 분류기를 도입한다.
  • 민감한 텍스트 쿼리에 학습 가능한 '편향 제거' 프롬프트 토큰을 첨부하여 적대자의 오차를 최대화함으로써 편향된 상관관계를 감소시킨다.
  • 일반적인 이미지-텍스트 쌍에 대한 대조 손실과 함께 편향 제거 목표를 공동 최적화하여 표현 품질을 유지한다.
  • 비용이 많이 들거나 원본 학습 데이터에 접근이 불가능한 재학습을 피하기 위해 오직 이미지 속성 레이블만을 감독으로 사용한다.
  • 보호된 속성 레이블이 부여된 얼굴 데이터셋(FairFace 및 UTKFace)에 이 방법을 적용한다.
  • 시각 및 언어 인코더를 동결한 채로 프롬프트 토큰을 엔드 투 엔드로 훈련한다.
Figure 1: Our proposed debiasing method for pretrained vision-language models . Sensitive text queries and images (with labeled attributes, e.g., Gender) are fed to their respective frozen text and image encoders. We employ an adversarial classifier which aims to predict the image attribute labels f
Figure 1: Our proposed debiasing method for pretrained vision-language models . Sensitive text queries and images (with labeled attributes, e.g., Gender) are fed to their respective frozen text and image encoders. We employ an adversarial classifier which aims to predict the image attribute labels f

실험 결과

연구 질문

  • RQ1시각-언어 모델에서 표현적 해를 탐지하는 데 가장 효과적인 편향 측정 지표는 무엇인가?
  • RQ2제안된 프롬프트 기반 적대적 편향 제거 방법은 기존의 편향 제거 기법과 비교해 편향 감소 및 표현 유지 측면에서 어떻게 다른가?
  • RQ3경량의 프롬프트 기반 방법이 메인 인코더의 파라미터를 미세조정하지 않고도 시각-언어 모델의 편향을 효과적으로 감소시킬 수 있는가?
  • RQ4대조 손실과의 공동 최적화가 편향 제거 과정에서 이미지-텍스트 표현 품질 저하를 어느 정도 방지하는가?
  • RQ5교차 속성(예: 인종과 성별)이 편향과 완화 성능에 어떤 영향을 미치는가?

주요 결과

  • MaxSkew와 NDKL는 시각-언어 모델에 대해 효과적인 편향 지표로 확인되었으며, WEAT는 이 다중모달 환경에서는 부적합한 것으로 밝혀졌다.
  • 제안된 방법은 FairFace 및 UTKFace 데이터셋에서 성별 및 인종 속성에 대해 MaxSkew와 NDKL를 크게 감소시켰다.
  • 대조 손실과의 공동 훈련 덕분에 이미지-텍스트 표현 품질에 대한 저하가 최소화되었다.
  • 더 큰 데이터셋에서 사전학습되거나 자기지도 학습(SSL)을 사용한 모델은 기존의 발견을 확인하며 더 낮은 기초 편향 수준을 보였다.
  • 속성이 조합된 경우(예: 인종과 성별)에도 효과적으로 편향을 감소시킬 수 있어 교차 편향 완화 잠재력이 있음을 시사한다.
  • 계산적으로 효율적이며 재학습 없이 기존 모델에 적용 가능하므로 실세계 구현에 적합하다.
Figure 2: The bias ( NDKL ) vs performance ( IN1K acc ) trade-off of our debiased models with varied ITC loss weights $\lambda$ (in red) and CLIP-clip using different numbers of removed dimensions $m$ (in blue).
Figure 2: The bias ( NDKL ) vs performance ( IN1K acc ) trade-off of our debiased models with varied ITC loss weights $\lambda$ (in red) and CLIP-clip using different numbers of removed dimensions $m$ (in blue).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.