Skip to main content
QUICK REVIEW

[논문 리뷰] UDIS: Unsupervised Discovery of Bias in Deep Visual Recognition Models

Arvindkumar Krishnakumar, Viraj Prabhu|arXiv (Cornell University)|2021. 10. 29.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

UDIS는 계층적 클러스터링과 기울기 가중 클래스 활성화 맵(GradCAM)을 사용하여 데이터셋 임beddings의 계층적 클러스터링과 기울기 가중 클래스 활성화 맵(GradCAM)을 사용하여 깊이 학습된 시각 인식 모델에서 편향을 탐지하는 비지도 학습 방법이다. 이는 모델이 체계적으로 성능이 떨어지는 하위집단을 식별함으로써 편향을 발견한다. 이 방법은 보호되는 속성(예: 인종, 성별)의 레이블이 필요로 하지 않으며, CelebA 및 MSCOCO 데이터셋에서 효과를 입증한다. 특히, 화면이 있는 이미지를 '컵'으로 잘못 분류하거나 테디베어를 '침대'와 연관지우는 등의 비의미적인 상관관계를 탐지한다.

ABSTRACT

Deep learning models have been shown to learn spurious correlations from data that sometimes lead to systematic failures for certain subpopulations. Prior work has typically diagnosed this by crowdsourcing annotations for various protected attributes and measuring performance, which is both expensive to acquire and difficult to scale. In this work, we propose UDIS, an unsupervised algorithm for surfacing and analyzing such failure modes. UDIS identifies subpopulations via hierarchical clustering of dataset embeddings and surfaces systematic failure modes by visualizing low performing clusters along with their gradient-weighted class-activation maps. We show the effectiveness of UDIS in identifying failure modes in models trained for image classification on the CelebA and MSCOCO datasets.

연구 동기 및 목표

  • 인종이나 성별과 같은 보호되는 속성의 비용이 많이 드는 수동 레이블링에 의존하지 않고 딥 러닝 모델의 편향을 탐지하는 데 도전하는 것.
  • 모델 성능이 크게 떨어지는 하위집단을 식별하는 비지도 학습 방법을 개발하여, 비의미적인 상관관계로 인한 체계적 실패 모드를 밝혀내는 것.
  • 실제 응용 분야에 배포하기 전에 딥 러닝 모델의 편향을 스케일러블하고 자동으로 감시할 수 있도록 하는 것.
  • GradCAM을 사용하여 이러한 실패 모드를 시각화하고 분석함으로써 모델 개발자가 편향을 이해하고 진단할 수 있도록 돕는 것.
  • 실제 데이터셋인 CelebA 및 MSCOCO와 같이, 맥락적으로 비의미적인 상관관계를 드러내는 방법의 효과성을 입증하는 것.

제안 방법

  • UDIS는 훈련된 모델의 테스트 세트에서 추출한 깊이 특징 임beddings에 대해 계층적 클러스터링을 수행하여 활성화 패tern이 뚜렷한 하위집단을 발견한다.
  • 전체 테스트 세트보다 유의미하게 낮은 정확도를 보이는 저성능 클러스터를 식별함으로써 체계적인 실패 모드를 나타낸다.
  • 각 저성능 클러스터에 대해 UDIS는 GradCAM 히트맵을 생성하여 예측 시 모델이 어떤 이미지 영역에 집중하는지 시각화한다.
  • 이 방법은 모델의 주의 맵을 활용하여 예측이 관련 특징이 아닌 비의미적인 힌트(예: 머리카락 색상, 칼라, 화면)에 의해 이뤄지는지 파악한다.
  • UDIS는 테스트 세트에만 의존하며 보호되는 속성의 레이블이 전혀 필요로 하지 않아 스케일러블하고 비용 효율적이다.
  • 이 접근법은 CelebA(미소 예측) 및 MSCOCO(다중 레이블 분류)에서 훈련된 모델에 적용되었으며, '컵'에 대해 화면이 있을 경우 과도하게 예측하거나 테디베어가 있을 경우 '침대'로 잘못 예측하는 등의 편향을 드러냈다.

실험 결과

연구 질문

  • RQ1보호되는 속성의 레이블이 없이도 비지도 학습 방법이 모델이 체계적으로 성능이 떨어지는 하위집단을 탐지할 수 있는가?
  • RQ2어떤 종류의 비의미적인 상관관계(예: 관련 없는 이미지 영역에 대한 의존)가 특정 하위집단에서 성능 저하를 유도하는가?
  • RQ3UDIS는 실생활 데이터셋에서 맥락적으로 편향된 특징(예: 화면, 모자, 머리카락 색상)과 관련된 실패 모드를 얼마나 효과적으로 드러내는가?
  • RQ4GradCAM 시각화는 발견된 실패 모드의 성격을 이해하고 검증하는 데 얼마나 도움이 되는가?
  • RQ5UDIS는 알려진 문화적 또는 데이터셋 편향(예: 인종이나 성별과 같은 특정 속성에 대한 일반화)과 일치하는 편향을 드러내는가?

주요 결과

  • UDIS는 편향이 있는 CelebA 데이터셋에서 모델이 '검은 머리카락' 영역에 집중하는 클러스터를 성공적으로 식별하여, 이는 '미소 예측'과 관련 없음에도 불구하고 학습된 편향을 시사한다.
  • MSCOCO 데이터셋에서 UDIS는 화면이 있는 이미지에서 '컵'을 과도하게 예측하는 것을 발견하여, 화면과 '컵' 사이에 비의미적인 상관관계가 있음을 드러냈다.
  • 이 방법은 테디베어가 존재할 경우 즉사로 '침대'로 예측하는 편향도 드러내었으며, 이는 테디베어와 침대 사이에 학습된 상관관계를 의미한다.
  • GradCAM 시각화 결과는 모델이 실제로 목표(예: 미소의 경우 입술)가 아닌 비의미적인 영역(예: 칼라, 머리카락)에 주의를 기울이고 있음을 확인하여, 비의미적인 특징으로 인한 모델의 불안정성을 시사한다.
  • UDIS는 보호되는 속성의 레이블 없이도 여러 클러스터에서 실패 모드를 탐지하여, 그 스케일러블성과 비지도 학습 성격을 입증했다.
  • 도구는 특정 하위집단에서 모델 성능이 크게 떨어지는 것을 드러냈으며, 시각적 설명을 통해 주의가 비관련 이미지 영역으로 잘못 이동되어 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.