Skip to main content
QUICK REVIEW

[논문 리뷰] ConvNets and ImageNet Beyond Accuracy: Understanding Mistakes and Uncovering Biases

Pierre Stock, Moustapha Cissé|arXiv (Cornell University)|2017. 11. 30.
Adversarial Robustness in Machine Learning참고 문헌 36인용 수 16
한 줄 요약

이 논문은 ImageNet에서 최신 기술의 ConvNet이 기존에 측정된 것보다 훨씬 더 정확하고 견고하다는 것을 입증한다. 인간 평가를 통해 상위-1 오차가 22.69%에서 9.47%로 감소함을 확인하였다. 또한, 적대적 예제를 활용한 모델 비판 기법을 도입하여 숨겨진 인종적 및 의미적 편향을 드러내었으며, 설명 기능이 잘못 분류를 완화하고 사용자 관점에서 모델의 결함을 드러내는 데 기여함을 보였다.

ABSTRACT

ConvNets and Imagenet have driven the recent success of deep learning for image classification. However, the marked slowdown in performance improvement combined with the lack of robustness of neural networks to adversarial examples and their tendency to exhibit undesirable biases question the reliability of these methods. This work investigates these questions from the perspective of the end-user by using human subject studies and explanations. The contribution of this study is threefold. We first experimentally demonstrate that the accuracy and robustness of ConvNets measured on Imagenet are vastly underestimated. Next, we show that explanations can mitigate the impact of misclassified adversarial examples from the perspective of the end-user. We finally introduce a novel tool for uncovering the undesirable biases learned by a model. These contributions also show that explanations are a valuable tool both for improving our understanding of ConvNets' predictions and for designing more reliable models.

연구 동기 및 목표

  • 표준 정확도 지표를 초월해 SOTA ConvNet의 ImageNet에서 진정한 성능을 재평가하는 것.
  • 사람의 판단이 기존에 상정된 것보다 모델 오류가 덜 심각하다는 것을 드러내는지 조사하는 것.
  • 설명 기능이 사용자 신뢰 및 적대적 예제에 대한 견고성 향상에 기여하는지 평가하는 것.
  • 모델이 ImageNet에서 학습한 바람직하지 않은 편향—특히 인종적 및 의미적 편향—을 탐지하고 드러내는 것.
  • 적대적 예제를 활용한 새로운 모델 비판 프레임워크를 개발하고 검증하는 것.

제안 방법

  • 5명의 평가자가 모델이 잘못 분류한 ImageNet 이미지가 실제로 올바르게 분류되었는지 판단하는 인간 주관 연구를 수행하였으며, 일致 기준으로 5명 중 4명 이상이 동의한 경우를 기준으로 하였다.
  • 시각화 기반 설명(선택도 맵)과 예시 기반 설명(프로토타입 및 비판, 즉 모델 비판)을 활용하여 예측을 해석하였다.
  • 적대적 예제를 활용해 모델의 직관에 어긋나거나 편향된 의사결정 패턴을 드러내는 비판을 생성하였다.
  • 다양한 설명 기반 기준을 적용: 적대적 선택, MMD-critic, 확률 기반 선택을 통한 모델 비판.
  • 피부색만 다를 뿐 내용이 동일한 이미지 쌍을 인터넷에서 수집하여 인종 편향을 테스트하였다.
  • ResNet-101을 ImageNet에서 훈련하고, 내부 표현을 활용해 편향 분석을 위한 프로토타입과 비판을 추출하였다.

실험 결과

연구 질문

  • RQ1인간의 일致 평가를 통해 SOTA ConvNet의 ImageNet 정확도가 얼마나 과소 평가되고 있는가?
  • RQ2설명 기능이 사용자 인식과 모델 예측에 대한 신뢰도에 어떤 영향을 미치며, 특히 적대적 예제에 대해 어떻게 작용하는가?
  • RQ3적대적 예제를 효과적으로 활용해 숨겨진 편향을 드러내는 모델 비판을 생성할 수 있는가?
  • RQ4모델이 ImageNet에서 학습하는 편향의 종류—특히 인종적 또는 의미적 편향—는 무엇이며, 어떻게 탐지할 수 있는가?
  • RQ5모델 비판이 다른 설명 방법에 비해 모델 결함과 편향을 드러내는 데 얼마나 효과적인가?

주요 결과

  • 인간 일치 평가를 통해 ResNet-101의 ImageNet 상위-1 오차가 22.69%에서 9.47%로 감소하여, 모델 오차가 크게 과소 평가되고 있음을 시사한다.
  • 상위-5 오차는 인간 평가 하에서 6.44%에서 1.94%로 감소하여, 인간 일치 기준으로 볼 때 ImageNet 문제가 거의 해결된 것으로 볼 수 있음을 시사한다.
  • 설명을 제공함으로써 적대적 예제가 사용자 인식에 미치는 영향이 크게 완화되었으며, 잘못 분류에 대한 신뢰도가 낮아졌다.
  • 적대적 예제를 활용한 모델 비판은 인종 편향을 효과적으로 드러내었으며, '농구' 클래스에 대한 프로토타입 중 78%가 최소한 한 명의 Black 사람을 포함한 반면, 흰 사람을 포함한 비율은 44%에 불과했다.
  • 비판의 경우, 90%는 흰 사람을 포함하지만, Black 사람을 포함한 비율은 단 20%에 불과하여, Black 플레이어가 이 클래스의 전형적인 대표로 여겨지는 강한 편향이 있음을 시사한다.
  • 피부색만 다른 이미지 쌍을 통해, Black 플레이어가 포함된 이미지는 100%의 비율로 '농구'로 분류되었지만, 피부색이 더 밝은 플레이어가 포함된 유사한 이미지는 다른 클래스로 잘못 분류되는 경향을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.