Skip to main content
QUICK REVIEW

[논문 리뷰] Discovering and Mitigating Visual Biases through Keyword Explanation

Younghyun Kim, Sangwoo Mo|arXiv (Cornell University)|2023. 01. 26.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 이미지 캡션의 언어 해석을 활용하여 시각 모델 내의 시각적 편향을 탐지하고 완화하는 Bias-to-Text (B2T) 프레임워크를 소개한다. 잘못 예측되거나 생성된 이미지의 캡션 키워드를 분석하고 CLIP 및 SD 점수 함수를 적용함으로써 B2T는 '플레이어'와 '여성' 또는 ' stethoscope'와 '간호사'와 같은 비합리적 연관성(예: 'player' with 'female', 'stethoscope' with 'nurse')를 식별하며, Waterbirds 데이터셋에서 악성 그룹 정확도를 11% 향상시키고 텍스트-이미지 모델에서 부당하거나 안전하지 않은 생성을 감소시킨다.

ABSTRACT

Addressing biases in computer vision models is crucial for real-world AI deployments. However, mitigating visual biases is challenging due to their unexplainable nature, often identified indirectly through visualization or sample statistics, which necessitates additional human supervision for interpretation. To tackle this issue, we propose the Bias-to-Text (B2T) framework, which interprets visual biases as keywords. Specifically, we extract common keywords from the captions of mispredicted images to identify potential biases in the model. We then validate these keywords by measuring their similarity to the mispredicted images using a vision-language scoring model. The keyword explanation form of visual bias offers several advantages, such as a clear group naming for bias discovery and a natural extension for debiasing using these group names. Our experiments demonstrate that B2T can identify known biases, such as gender bias in CelebA, background bias in Waterbirds, and distribution shifts in ImageNet-R/C. Additionally, B2T uncovers novel biases in larger datasets, such as Dollar Street and ImageNet. For example, we discovered a contextual bias between "bee" and "flower" in ImageNet. We also highlight various applications of B2T keywords, including debiased training, CLIP prompting, and model comparison.

연구 동기 및 목표

  • 사전 정의된 편향 카테고리에 의존하지 않고도 비지도 시각적 편향을 진단하고 완화하는 데 도전하는 것.
  • 이미지에서 자연어 기반 설명을 생성하고 공통 키워드를 추출함으로써 설명 가능한 편향 탐지 기능을 제공하는 것.
  • 이미지 분류기와 텍스트-이미지 생성 모델 모두에 적용 가능한 보편적이고 모델에 종속되지 않는 프레임워크를 개발하는 것.
  • 제로샷 분류기에서 악성 그룹의 내성 강화를 향상시키고, 확산 모델에서 부당하거나 안전하지 않은 이미지 생성을 줄이는 것.
  • 언어 기반의 시각적 편향 패턴 분석을 활용한 실용적이고 확장 가능한 모델 완화 방법을 제공하는 것.

제안 방법

  • 예측 오류가 발생한 이미지나 텍스트 조건 기반으로 생성된 이미지와 같은 편향 가능성이 있는 이미지에서 자연어 설명을 생성하기 위해 사전 학습된 캡션 모델(예: CLIP-Cap)을 사용한다.
  • 이러한 캡션에서 공통 키워드를 추출하여 편향된 예측이나 생성과 관련된 반복적인 용어를 식별한다.
  • 편향 키워드와 잘못 예측된 이미지 간의 유사도를 측정하기 위해 CLIP 점수를 제안하여 모델 실패와의 일치를 확보한다.
  • 원본 프롬프트와 편향 키워드 간의 확산 점수 비교를 통해 생성된 이미지가 편향 키워드를 반영하고 있는지 확인하기 위해 SD(Stable Diffusion) 점수를 도입한다.
  • 식별된 키워드를 활용해 모델을 완화한다: 제로샷 분류기의 프롬프트를 보강하거나 텍스트-이미지 모델에서 확산 점수를 이끌어내는 데 사용한다.
  • 이 프레임워크를 이미지 분류 및 텍스트-이미지 생성 작업 모두에서 비합리적 연관성(예: 'spurious correlations')을 탐지하고 완화하는 데 적용한다.

실험 결과

연구 질문

  • RQ1이미지 캡션의 언어 해석이 비지도 시각적 편향을 효과적으로 드러내는 데 유용한가?
  • RQ2CLIP 및 SD와 같은 점수 함수를 사용해 캡션 이미지에서 편향 키워드를 걸러내고 검증할 수 있는가?
  • RQ3키워드 기반 완화가 제로샷 이미지 분류기에서 악성 그룹 정확도를 얼마나 향상시킬 수 있는가?
  • RQ4B2T 프레임워크는 성별 또는 노골적 성적 표현 편향과 같은 부당하거나 안전하지 않은 속성을 텍스트-이미지 생성에서 탐지하고 완화할 수 있는가?
  • RQ5B2T 프레임워크는 분류기 및 생성 모델 아키텍처를 포함한 다양한 시각 모델 간에 일반화 가능한가?

주요 결과

  • B2T 프레임워크는 이전에 발견되지 않은 '플레이어'와 '여성' 간의 비합리적 연관성(예: 'player' with 'female')을 카글 페이스 데이터셋에서 발견하였다.
  • B2T를 활용한 완화로 Waterbirds 데이터셋에서 기준 모델 대비 악성 그룹 정확도가 11% 향상되었다.
  • 텍스트-이미지 모델의 경우, B2T가 '간호사'가 '여성'과 연결되거나 ' stethoscope'와 같은 성별 편향을 성공적으로 탐지하였고, 생성된 이미지에서 '누드'와 같은 안전하지 않은 편향도 탐지하였다.
  • SD 점수는 생성된 이미지에서 안전하지 않거나 부당한 속성을 효과적으로 식별하였으며, 낮은 점수는 강한 편향 존재를 나타내었다.
  • 이 프레임워크는 ImageNet-C 및 다양한 텍스트-이미지 프롬프트를 포함한 다양한 벤치마크에서 뛰어난 성능을 보였으며, 일관된 편향 탐지 능력을 입증하였다.
  • CLIP 및 SD 점수의 사용으로 거짓 긍정 편향 키워드가 크게 감소하여 식별된 편향의 신뢰도가 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.