Skip to main content
QUICK REVIEW

[논문 리뷰] Which Shortcut Cues Will DNNs Choose? A Study from the Parameter-Space Perspective

Luca Scimeca, Seong Joon Oh|arXiv (Cornell University)|2021. 10. 06.
Domain Adaptation and Few-Shot Learning참고 문헌 34인용 수 10
한 줄 요약

이 논문은 깊이 있는 신경망(DNNs)이 여러 단서가 동일하게 예측 가능할 때조차도 일부 단서(예: 색상 또는 민족성)를 다른 것들보다 선호하는 이유를 조사한다. 합성 및 실제 데이터셋을 사용한 새로운 WCST-ML 훈련 설정을 통해 저자들은 매개변수 공간 내에서 더 높은 빈도를 보이는 단서, 즉 콜모고로프 단순성(Kolmogorov-simple) 단서를 선호함을 보이며, 이는 편향된 일반화와 윤리적 위험을 초래하며, 모델 편향을 수정하기 위한 적극적인 인간 간섭이 필요하다고 주장한다.

ABSTRACT

Deep neural networks (DNNs) often rely on easy-to-learn discriminatory features, or cues, that are not necessarily essential to the problem at hand. For example, ducks in an image may be recognized based on their typical background scenery, such as lakes or streams. This phenomenon, also known as shortcut learning, is emerging as a key limitation of the current generation of machine learning models. In this work, we introduce a set of experiments to deepen our understanding of shortcut learning and its implications. We design a training setup with several shortcut cues, named WCST-ML, where each cue is equally conducive to the visual recognition problem at hand. Even under equal opportunities, we observe that (1) certain cues are preferred to others, (2) solutions biased to the easy-to-learn cues tend to converge to relatively flat minima on the loss surface, and (3) the solutions focusing on those preferred cues are far more abundant in the parameter space. We explain the abundance of certain cues via their Kolmogorov (descriptional) complexity: solutions corresponding to Kolmogorov-simple cues are abundant in the parameter space and are thus preferred by DNNs. Our studies are based on the synthetic dataset DSprites and the face dataset UTKFace. In our WCST-ML, we observe that the inborn bias of models leans toward simple cues, such as color and ethnicity. Our findings emphasize the importance of active human intervention to remove the inborn model biases that may cause negative societal impacts.

연구 동기 및 목표

  • 다양한 단서가 동일하게 예측 가능할 때 DNNs가 특정 단서를 다른 것들보다 선호하는 이유를 이해하는 것.
  • 매개변수 공간 기하학이 특정 단서에 대한 모델 편향을 어떻게 형성하는지 조사하는 것.
  • 단서의 콜모고로프 복잡도와 학습된 DNN 해의 일반성 사이의 관계를 조사하는 것.
  • 민족성 또는 피부색과 같은 단순하지만 윤리적으로 문제가 될 수 있는 단서에 의존하는 DNNs의 사회적 영향을 평가하는 것.
  • 미래 연구를 위해 단서 복잡도 측정 도구와 매개변수 공간 내 해 경로 추적 방법을 제공하는 것.

제안 방법

  • 다양한 단서(색상, 모양, 크기)가 동일하게 유효한 합성 데이터셋(WCST-ML)을 설계하여 DNNs의 단서 선호도를 고립시키는 것.
  • 피드포워드, ResNet, 비전 트랜스포머 등 다양한 DNN 아키텍처를 대각선 훈련 세트에 훈련시켜 단서 선택 행동을 관찰하는 것.
  • 비대각선 테스트 샘플을 사용하여 모델의 예측 기반으로 어떤 단서에 의존하는지 해독하는 것.
  • 각 단서의 콜모고로프 복잡도(KC)를 측정하여 그 기술적 단순성을 정량화하는 것.
  • 각 단서에 편향된 매개변수 공간 해의 부피를 분석하여, 단순한 단서가 훨씬 더 큰 영역을 차지함을 발견하는 것.
  • 다양한 단서에 편향된 해 사이의 연속 경로를 추적하기 위해 이질적인 0 손실 곡선을 구성하여 손실 곡면 내 기하학적 차이를 확인하는 것.

실험 결과

연구 질문

  • RQ1여러 단서가 동일하게 예측 가능할 때 DNNs가 왜 특정 단서를 다른 것들보다 일관되게 선호하는가?
  • RQ2매개변수 공간의 기하학적 구조가 특정 단서에 편향된 해의 일반성에 어떻게 영향을 미치는가?
  • RQ3단서의 콜모고로프 복잡도가 DNN이 그 단서를 선택할 가능성을 얼마나 정확히 예측할 수 있는가?
  • RQ4매개변수 공간 내 단순성 편향이 분포 이동 상황에서 모델 일반화에 어떤 영향을 미치는가?
  • RQ5민족성 또는 피부색과 같은 단순하고 사회적으로 민감한 단서를 선호하는 DNNs의 윤리적 함의는 무엇인가?

주요 결과

  • 대상 레이블과의 상관관계가 동일하게 유지되더라도, DNNs는 오리엔테이션과 같은 더 복잡한 단서보다 색상이나 민족성과 같은 낮은 콜모고로프 복잡도를 가진 단서를 일관되게 선호한다.
  • 단순한 단서에 편향된 해는 복잡한 단서에 편향된 해보다 매개변수 공간 내에서 훨씬 더 큰 부피를 차지한다.
  • 단순한 단서를 선호하는 해 주변의 손실 곡면은 복잡한 단서를 선호하는 해 주변보다 더 평탄하여 더 높은 안정성과 수렴 안정성을 나타낸다.
  • 이 단순성 편향은 ResNets와 비전 트랜스포머를 포함한 다양한 아키텍처에서 일관되게 나타나며, 무작위 가중치 초기화와는 독립적이다.
  • 실험 결과는 단서의 콜모고로프 복잡도와 모델의 선호도 사이에 강한 음의 상관관계가 있음을 확인하여, 단순성과 해의 일반성 사이의 이론적 연결을 검증한다.
  • 본 연구는 DNNs가 자연스럽게 단순한 단서를 선호하는 경향이 있어, 민족성이나 피부색과 같은 단서를 단서로 사용할 경우 유해한 사회적 편향을 초래할 수 있음을 드러내며, 모델 행동을 수정하기 위한 적극적인 인간 간섭이 필요하다고 결론내린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.