Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Not to Learn: Training Deep Neural Networks with Biased Data

Byungju Kim, Hyunwoo Kim|arXiv (Cornell University)|2018. 12. 26.
Adversarial Robustness in Machine Learning참고 문헌 24인용 수 22
한 줄 요약

이 논문은 훈련 데이터의 임의의 상관관계를 제거하기 위해 깊이 있는 특징 임bedding과 타겟 데이터 편향 간 상호정보를 최소화하는 새로운 정규화 방법을 제안한다. 특징에서 편향을 예측하기 위해 적대적으로 훈련되는 판별기 덕분에 주 네트워크는 편향에 영향을 받지 않는 표현을 학습하게 되며, 이는 훈련 데이터와는 다른 편향 분포를 가진 테스트 데이터에서 일반화 능력을 크게 향상시킨다.

ABSTRACT

We propose a novel regularization algorithm to train deep neural networks, in which data at training time is severely biased. Since a neural network efficiently learns data distribution, a network is likely to learn the bias information to categorize input data. It leads to poor performance at test time, if the bias is, in fact, irrelevant to the categorization. In this paper, we formulate a regularization loss based on mutual information between feature embedding and bias. Based on the idea of minimizing this mutual information, we propose an iterative algorithm to unlearn the bias information. We employ an additional network to predict the bias distribution and train the network adversarially against the feature embedding network. At the end of learning, the bias prediction network is not able to predict the bias not because it is poorly trained, but because the feature embedding network successfully unlearns the bias information. We also demonstrate quantitative and qualitative experimental results which show that our algorithm effectively removes the bias information from feature embedding.

연구 동기 및 목표

  • 편향된 훈련 데이터에서 깊이 있는 신경망이 비의도적인 상관관계를 학습함으로써, 훈련 데이터와 다른 편향 분포를 가진 테스트 데이터에서 일반화 능력이 저하되는 문제를 해결하기 위해.
  • 학습된 특징 임베딩과 타겟 데이터 편향 간 상호정보를 명시적으로 최소화하는 정규화 기법을 개발하기 위해.
  • 편향되지 않은 훈련 데이터가 필요 없이도 깊이 있는 네트워크가 분리된, 편향에 강인한 표현을 학습할 수 있도록 하기 위해.
  • 특징에서 편향 정보를 제거하면 모델 성능과 내성적 안정성이 향상됨을 보여주며, 이는 거의 편향이 없는 데이터로 훈련된 모델을 뛰어넘는 결과를 낳을 수 있음을 입증하기 위해.

제안 방법

  • 특징 임베딩과 타겟 편향 간 상호정보를 최소화하기 위한 정규화 손실을 설정하여 분리된 표현을 장려하기 위해.
  • 주 특징 인코더와 대립적으로 훈련되는 보조 편향 예측 네트워크를 설계하여 특징에서 편향을 예측할 수 있는 능력을 극대화하기 위해.
  • 주 네트워크를 최소화하도록 최적화하여 분류 손실과 예측된 편향과의 상호정보를 모두 줄이며, 최소-최대 게임 설정을 사용하기 위해.
  • 반복적 훈련을 통해 주 네트워크가 타겟 편향에 강인한 표현을 학습하면서도 높은 분류 정확도를 유지할 수 있도록 하기 위해.
  • 통제된 편향 훈련 세트를 공개 데이터셋에 생성하기 위한 편향 심기 프로토콜을 도입하여 편향 제거 성능 평가 가능하게 하기 위해.
  • 실제 세계 데이터셋인 EMNIST, 개 vs. 고양이, IMDB 얼굴 데이터셋을 사용하여 색상, 연령, 성별을 타겟 편향으로 삼아 이미지 분류 작업에 방법을 적용하기 위해.

실험 결과

연구 질문

  • RQ1특징과 타겟 편향 간 상호정보 최소화가 깊이 있는 신경망에서 비의도적인 상관관계를 효과적으로 제거할 수 있는가?
  • RQ2편향 예측기와의 적대적 훈련이 더 견고하고 편향에 강인한 특징 표현을 만들어내는가?
  • RQ3특징에서 편향 정보를 제거하면, 훈련 데이터와 다른 편향 분포를 가진 테스트 데이터에서도 일반화 성능이 향상되는가?
  • RQ4기본 모델 및 거의 편향이 없는 데이터로 훈련된 모델과 비교해 본다면, 제안된 방법의 성능은 어떻게 되는가?
  • RQ5편향이 타겟 레이블과 독립적(예: 색상) 인 경우와 관련된(예: 연령과 성별) 경우에 비해 성능 향상 정도는 어느 정도인가?

주요 결과

  • 색상 편향이 있는 EMNIST 데이터셋에서 제안된 방법은 86.66%의 테스트 정확도를 기록하여 기준 모델(84.42%)과 BlindEye(85.56%)를 뛰어넘어 뚜렷한 성능 향상을 보였다.
  • 개 vs. 고양이 데이터셋에서 모델은 테스트 이미지의 색상 편향을 효과적으로 忽略했으며, 스택형 막대도표를 통해 예측이 색상과 독립적임을 보였다. 반면 기준 모델은 그렇지 못했다.
  • IMDB 얼굴 데이터셋에서 모델은 성별 분류 과정에서 연령 편향을 감소시켰으며, 예측 결과가 연령과 독립적이 되었음을 정성적 결과로 확인했다.
  • 거의 편향이 없는 데이터로 훈련된 'Gray' 기준 모델보다 대부분의 실험에서 성능이 뛰어나, 편향 제거가 특징의 정보성 향상에 기여함을 시사한다.
  • 편향이 타겟 레이블과 독립적일 경우(예: 숫자 분류에서의 색상) 성능 향상이 가장 두드러졌으며, 이는 편향 제거가 진정으로 관련이 없는 경우에 가장 효과적임을 시사한다.
  • 연령과 성별처럼 관련된 편향이 있는 경우 성능 향상은 미미했으며, 이는 편향 제거가 항상 유익하지 않으며 데이터 구조에 따라 달라질 수 있음을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.