Skip to main content
QUICK REVIEW

[논문 리뷰] Identifying Spurious Correlations and Correcting them with an Explanation-based Learning

Misgina Tsighe Hagos, Kathleen M. Curran|arXiv (Cornell University)|2022. 11. 15.
Explainable Artificial Intelligence (XAI)인용 수 5
한 줄 요약

이 논문은 평균 몬테 카를로 드롭아웃을 통해 모델의 불확실성 변화를 분석함으로써, 이미지 분류기에서 유사 상관관계를 탐지하기 위한 편향 기반 방법을 제안한다. 이후 설명 기반 미세조정을 통해 이러한 상관관계를 수정함으로써, 모델이 관련 없는 이미지 영역에 과도하게 의존하는 것을 줄이고 강건성을 향상시킨다. 그 결과, 개선 후 평균 몬테 카를로 드롭아웃 변화가 0.50에서 0.15로 감소함을 통해 확인되었다.

ABSTRACT

Identifying spurious correlations learned by a trained model is at the core of refining a trained model and building a trustworthy model. We present a simple method to identify spurious correlations that have been learned by a model trained for image classification problems. We apply image-level perturbations and monitor changes in certainties of predictions made using the trained model. We demonstrate this approach using an image classification dataset that contains images with synthetically generated spurious regions and show that the trained model was overdependent on spurious regions. Moreover, we remove the learned spurious correlations with an explanation based learning approach.

연구 동기 및 목표

  • 이미지 분류기가 학습한 유사 상관관계가 모델의 신뢰성에 악영향을 미치는지를 규명하는 것.
  • 수동적인 인스턴스 컬렉션 없이도 자동으로 편향 기반 방법을 통해 비필수적인 이미지 영역에 대한 과도한 의존도를 탐지하는 것.
  • 설명 기반 학습을 통해 유사 상관관계를 수정하여 모델이 혼란 요소 특징에 의존하는 정도를 줄이는 것.
  • 불확실성 모니터링과 대상 지정된 미세조정을 통한 예측 개선을 통해 모델의 강건성을 향상시키는 것.

제안 방법

  • 목표 클래스 이미지에서 유래한 패치로 4x4 픽셀 영역을 대체하여 이미지 수준의 편향을 적용해 파괴적인 변화를 시뮬레이션한다.
  • 100번의 순방향 전파를 통해 평균 몬테 카를로 드롭아웃을 사용해 모델의 불확실성 변화를 모니터링하여 예측 신뢰도의 급격한 감소를 탐지한다.
  • 평균 몬테 카를로 드롭아웃 값의 감소 폭이 가장 큰 영역을 유사 영역으로 식별하여 과도한 의존도를 나타낸다.
  • 식별된 유사 영역에 대한 민감도를 줄이기 위해 설명 기반 학습(식 3)을 사용해 모델을 미세조정한다.
  • 검증을 위해 통제된 데이터셋에서 합성된 유사 영역을 사용하여 탐지 및 수정의 유효성을 검증한다.
  • 미세조정 이전과 이후의 평균 몬테 카를로 드롭아웃 변화를 비교하여 유사 상관관계 영향의 감소 정도를 정량화한다.

실험 결과

연구 질문

  • RQ1수동적인 실패 케이스 레이블링이 없이도 이미지 수준의 편향이 모델 예측에서 유사 상관관계를 효과적으로 식별할 수 있는가?
  • RQ2모델이 유사 이미지 영역에서 편향을 가할 경우, 그에 따른 예측 신뢰도가 얼마나 감소하는가? 이는 과도한 의존도를 나타내는가?
  • RQ3설명 기반 학습이 편향 분석을 통해 식별된 유사 이미지 영역에 대한 모델의 의존도를 성공적으로 줄일 수 있는가?
  • RQ4유사 상관관계를 수정한 후, 불확실성의 크기 변화(평균 몬테 카를로 드롭아웃으로 측정)는 어떻게 변화하는가?

주요 결과

  • 분류 손실만으로 학습된 모델은 편향에 대해 평균 몬테 카를로 드롭아웃 변화가 0.50를 보이며, 유사 영역에 매우 민감한 것으로 나타났다.
  • 합성적으로 추가된 유사 영역를 편향했을 때 평균 몬테 카를로 드롭아웃의 감소 폭이 가장 크게 나타나, 이들이 주요 예측 요소임을 확인했다.
  • 설명 기반 미세조정 이후 평균 몬테 카를로 드롭아웃 변화는 0.15로 감소하여, 유사 특징에 대한 민감도가 감소함을 입증했다.
  • 시각적 점검 결과, 가장 파괴적인 편향이 식별된 유사 영역을 향해 작용했으며, 이는 탐지 방법의 타당성을 검증했다.
  • 개선된 모델은 편향이 가해진 테스트 이미지에서도 정확한 예측을 유지했으며, 이는 강건성이 향상되고 혼란 요소 특징에 대한 과도한 의존도가 감소했음을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.