Skip to main content
QUICK REVIEW

[논문 리뷰] Predictive Multiplicity in Classification

Charles T. Marx, Flávio P. Calmon|arXiv (Cornell University)|2019. 09. 14.
Bayesian Modeling and Causal Inference참고 문헌 52인용 수 34
한 줄 요약

이 논문은 분류에서 예측적 다중성(predictive multiplicity)을 정의하고, 모호도(ambiguity)와 불일치(discrepancy) 지표를 도입하며, 선형 분류기에 대해 이를 정확히 계산하기 위한 정수 계획(int programming) 도구를 개발한다. 이는 재범 예측 데이터셋에서 다중성이 상당함을 보여준다.

ABSTRACT

Prediction problems often admit competing models that perform almost equally well. This effect challenges key assumptions in machine learning when competing models assign conflicting predictions. In this paper, we define predictive multiplicity as the ability of a prediction problem to admit competing models with conflicting predictions. We introduce formal measures to evaluate the severity of predictive multiplicity and develop integer programming tools to compute them exactly for linear classification problems. We apply our tools to measure predictive multiplicity in recidivism prediction problems. Our results show that real-world datasets may admit competing models that assign wildly conflicting predictions, and motivate the need to measure and report predictive multiplicity in model development.

연구 동기 및 목표

  • 예측적 다중성을 정의하고 분류 작업에서 그 실질적 함의를 동기 부여한다.
  • 다중성을 정량화하기 위한 형식적 지표(모호도와 불일치)를 도입한다.
  • 선형 분류기에 대해 이 지표를 정확히 계산하기 위한 정수 프로그래밍 방법을 개발한다.
  • 실제 재범 예측 데이터셋(예: COMPAS)에서 예측적 다중성을 경험적으로 평가한다.

제안 방법

  • 기준 분류기를 중심으로 ε-레벨 집합을 정의하여 거의 최적에 가까운 모델들을 포착한다.
  • ε 제약 하에서 기반과의 최대 불일치(불일치)를 계산하기 위해 DiscMIP를 형식화한다.
  • 여러 ε 값에 걸친 불일치를 효율적으로 계산하기 위한 경로 알고리즘을 개발한다.
  • 특정 데이터 포인트의 예측을 뒤집도록 분류기를 구성하는 FlipMIP를 형식화한다.
  • 혼합 정수 프로그래밍 해법을 사용하여 다중성 지표의 정확한 해나 상한/하한 해를 얻는다.

실험 결과

연구 질문

  • RQ1이진 분류에 대해 예측적 다중성을 형식적으로 어떻게 정의할 수 있는가?
  • RQ2모호도와 불일치를 통해 다중성의 정도를 어떻게 정량화할 수 있는가?
  • RQ3최적화 기법을 사용하여 선형 분류기에 대해 이 지표들을 정확히 계산할 수 있는가?
  • RQ4재범 예측과 같은 실제 데이터셋에서 예측적 다중성은 어느 정도인가?
  • RQ5다중성 지표가 기준 모델 정확도 및 배포 결정과 어떤 관계가 있는가?

주요 결과

  • 거의 같은 정확도를 가진 대립 모델들이 동일한 데이터에 대해 매우 상충하는 예측을 할 수 있다.
  • ProPublica COMPAS 데이터셋에서, 최고 모델보다 1% 더 정확도가 낮은 경쟁 모델이 17%가 넘는 개인에게 상충하는 예측을 할 수 있으며, 44%의 개인의 예측은 모델 선택에 의해 영향을 받는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.