Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Noise Induces Loss Discrepancy Across Groups

Fereshte Khani, Percy Liang|arXiv (Cornell University)|2019. 11. 22.
Machine Learning and Data Classification인용 수 5
한 줄 요약

이 논문은 특성 노이즈가 조건부로 균일하게 적용되더라도 선형 회귀에서 통계적 손실 불일치를 유도함을 보여주며, 주로 그룹 평균과 분산의 차이로 인해 발생한다. 핵심 발견은 무한한 데이터와 정보 부족이 없음에도 손실 불일치가 지속된다는 것이며, 그룹 정보를 사용하면 통계적 손실 불일정을 줄일 수 있지만 반대로 역설적 손실 불일치를 증가시켜 분포 이동에 더 강건한 성능을 보인다.

ABSTRACT

The performance of standard learning procedures has been observed to differ widely across groups. Recent studies usually attribute this loss discrepancy to an information deficiency for one group (e.g., one group has less data). In this work, we point to a more subtle source of loss discrepancy---feature noise. Our main result is that even when there is no information deficiency specific to one group (e.g., both groups have infinite data), adding the same amount of feature noise to all individuals leads to loss discrepancy. For linear regression, we thoroughly characterize the effect of feature noise on loss discrepancy in terms of the amount of noise, the difference between moments of the two groups, and whether group information is used or not. We then show this loss discrepancy does not vanish immediately if a shift in distribution causes the groups to have similar moments. On three real-world datasets, we show feature noise increases the loss discrepancy if groups have different distributions, while it does not affect the loss discrepancy on datasets where groups have similar distributions.

연구 동기 및 목표

  • 정보 부족(예: 데이터 부족 또는 편향된 타겟)이 없는 상황에서도 특성 노이즈가 그룹 간 손실 불일치를 유도할 수 있는지 조사하기 위해.
  • 그룹 정보의 사용이 선형 회귀 모델에서 통계적 손실 불일치와 역설적 손실 불일치에 미치는 영향을 분석하기 위해.
  • 특성 분포 변화 조건 하에서 손실 불일치의 지속성, 특히 훈련 및 테스트 분포 간 차이가 불일치에 미치는 영향을 이해하기 위해.
  • 평균, 분산, 크기에서 그룹 간 차이가 있는 실제 데이터셋을 통해 이론적 결과를 검증하기 위해.

제안 방법

  • 개개인이 그룹 g ∈ {0,1}에 속하는 선형 회귀 설정을 사용하며, 잠재적 특성 z가 타겟 y = βᵀz + α를 생성한다.
  • 관측된 특성 x는 두 관측 함수를 통해 z의 노이즈 있는 복사본으로 모델링된다: o₋g(z,g,u) = z + u (그룹 정보 없음) 및 o₊g(z,g,u) = [z + u, g] (그룹 정보 있음), 여기서 u는 평균 0인 노이즈이다.
  • 통계적 손실 불일치(SLD)는 그룹 간 기대 손실의 차이로 정의되며, 역설적 손실 불일치(CLD)는 한 개인과 다른 그룹의 반대 조건에서의 그의 손실 차이를 측정한다.
  • 이론적 분석을 통해 SLD와 CLD가 발생하는 조건을 유도하며, SLD는 그룹의 모멘트(평균, 분산, 크기)의 차이에 의존하는 반면, CLD는 그룹 정보를 사용할 경우 훈련 분포의 차이에서 기인한다.
  • 손실 불일치를 훈련 및 테스트 분포의 모멘트에 관련된 구성요소로 분해하여, 그룹의 모멘트가 유사할 경우 분포 이동 시 SLD가 즉시 사라짐을 보여준다.
  • 실제 데이터셋인 Students, Law School, Communities&Crime 세 개를 사용하여 추가된 노이즈와 특성 생략을 노이즈의 대체 측정 수단으로 활용해 실증적 검증을 수행한다.

실험 결과

연구 질문

  • RQ1두 그룹이 무한한 데이터를 가지고 있고 정보 부족이 없음에도 특성 노이즈가 그룹 간 통계적 손실 불일치를 유도하는가?
  • RQ2관측 함수에 그룹 소속 정보를 포함시키면 통계적 손실 불일치와 역설적 손실 불일치에 어떤 영향을 미치는가?
  • RQ3특성 분포 변화 조건 하에서 손실 불일치는 어느 정도 지속되며, 그룹 정보의 사용은 이러한 지속성에 어떤 영향을 미치는가?
  • RQ4데이터 수집 또는 그룹별 분류기로 손실 불일치를 완화할 수 있는가, 아니면 노이즈와 분포 차이에 의해 본질적으로 유도되는가?
  • RQ5분포 이동 후 손실 불일치가 어떤 조건에서 사라지며, 그룹 정보의 사용은 이러한 행동에 어떤 영향을 미치는가?

주요 결과

  • 특성 노이즈는 무한한 데이터와 정보 부족이 없음에도 선형 회귀에서 통계적 손실 불일치를 유도하며, 잔차 손실의 경우 이 불일치는 그룹 평균의 차이에 비례하고, 제곱 오차 손실의 경우는 분산의 차이에 비례한다.
  • 그룹 정보를 사용하면 통계적 손실 불일치는 감소하지만, 반대로 역설적 손실 불일치는 증가하여 공정성 지표 간의 상충 관계가 드러난다.
  • 그룹 정보 없이 관측 함수를 사용할 경우(SLD, o₋g)의 통계적 손실 불일치는 주로 테스트 분포의 차이에 의해 주도되며, 분포 이동 후 그룹의 모멘트가 유사해지면 즉시 사라진다.
  • 그룹 정보를 포함한 관측 함수를 사용할 경우(CLD, o₊g)의 역설적 손실 불일치는 주로 훈련 분포의 차이에서 기인하며, 분포 이동 후 즉시 사라지지 않아 더 지속적인 경향을 보인다.
  • 평균, 분산, 크기에서 그룹 간 차이가 있는 실제 데이터셋인 Communities&Crime와 Students에서는 특성 노이즈가 손실 불일치를 증가시키지만, 그룹 간 유사성이 높은 Law School에서는 노이즈가 영향을 미치지 않는다.
  • 그룹 평균을 보정하여 데이터셋을 재가중한 후, o₋g의 통계적 손실 불일치는 즉시 사라지지만, o₊g의 손실 불일치는 Proposition 3의 이론적 분석과 일치하는 비율로 서서히 감소한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.