Skip to main content
QUICK REVIEW

[논문 리뷰] Assessing Fairness in Classification Parity of Machine Learning Models in Healthcare

Ming Yuan, Vikas Kumar|arXiv (Cornell University)|2021. 02. 07.
Ethics and Social Impacts of AI참고 문헌 4인용 수 7
한 줄 요약

이 논문은 인종, 성별, 연령과 같은 보호되는 특성에 대한 분류 일치도를 중심으로 의료 분류 모델에서의 공정성 평가 및 향상을 위한 프레임워크를 제안한다. 그룹 간 성능 변동성을 측정하고, 클래스 불균형을 해결하기 위해 샘플링을 적용하며, 공정성 임계값을 규명함으로써, 높은 정확도가 공정성을 보장하지는 않으며, 대체 특성(feature)을 제거한다고 해서 공정성 또는 성능이 향상되지 않는다는 것을 발견하였다.

ABSTRACT

Fairness in AI and machine learning systems has become a fundamental problem in the accountability of AI systems. While the need for accountability of AI models is near ubiquitous, healthcare in particular is a challenging field where accountability of such systems takes upon additional importance, as decisions in healthcare can have life altering consequences. In this paper we present preliminary results on fairness in the context of classification parity in healthcare. We also present some exploratory methods to improve fairness and choosing appropriate classification algorithms in the context of healthcare.

연구 동기 및 목표

  • 인종, 성별, 연령과 같은 보호되는 특성에 대한 분류 일치도를 사용하여 의료 기계학습 모델의 공정성을 평가하기.
  • 보호되는 특성 및 대체 특성(feature)을 제거했을 때 모델 성능과 공정성에 미치는 영향을 평가하기.
  • 과소표현된 그룹의 클래스 불균형을 완화하기 위한 데이터 수준의 간입 조치인 오버샘플링을 탐색하기.
  • 예측 성능와 공정성을 균형 잡는 데 도움이 되는 공정성 임계값을 규명하기.
  • 실제 의료 데이터셋에서 로지스틱 회귀, 랜덤 포레스트, XGBoost 간의 모델 공정성 비교하기.

제안 방법

  • 보호된 그룹 간 예측 성능(AUC)의 변동성을 측정하여 불공정성을 나타내는 지표로 사용하며, 높은 변동성을 불공정성의 징후로 간주한다.
  • 인종, 연령과 같은 보호된 특성에서 과소표현된 카테고리의 균형을 맞추기 위해 오버샘플링을 적용하여 데이터 불균형으로 인한 편향을 감소시킨다.
  • 기울기 부스팅 특성 중요도 점수를 사용하여 보호된 특성과 관련이 높은 중요한 대체 특성(feature)을 규명한다.
  • 보호된 특성과 관련이 높은 상위-k개의 중요한 특성을 제거하여 그 영향이 공정성과 성능에 미치는 영향을 테스트한다.
  • 각 그룹별 최적의 분류 임계값을 결정하여 성능 유지와 함께 공정성을 향상시킨다.
  • AUC와 AUC의 변동성을 지표로 사용하여 로지스틱 회귀, 랜덤 포레스트, XGBoost 세 모델 간의 공정성과 성능을 비교한다.

실험 결과

연구 질문

  • RQ1보호된 그룹 간 예측 성능의 변동성이 의료 기계학습 모델에서의 불공정성을 어떻게 나타내는가?
  • RQ2보호된 특성과 관련된 대체 특성을 제거할 경우 성능 저하 없이 공정성이 얼마나 향상되는가?
  • RQ3과소표현된 그룹의 샘플링을 통해 균형을 맞추는 것이 공정성과 최적의 분류 임계값에 어떤 영향을 미치는가?
  • RQ4예측 성능가능성을 유지하면서 공정성을 향상시킬 수 있는 공정성 임계값을 규명할 수 있는가?
  • RQ5높은 모델 정확도가 보호된 그룹 간에 반드시 더 공정한 결과를 의미하는가?

주요 결과

  • 보호된 특성과 관련된 중요한 대체 특성을 제거했을 때 성능 변동성은 감소하지 않았고, 전체 모델 성능은 하락했다.
  • 대체 특성을 제거한 후에도 성능 변동성이 여전히 높게 유지되어, 관련 특성을 통한 간접적 영향이 특성 제거로 쉽게 제거되지 않는다는 것을 시사한다.
  • 오버샘플링을 통해 인종, 연령과 같은 보호된 특성의 클래스 분포를 균형 잡아주었고, 이로 인해 공정성을 높이기 위한 최적의 분류 임계값에 유의미한 변화가 발생했다.
  • XGBoost는 가장 높은 AUC를 기록했지만, 그룹 간 AUC의 변동성 또한 가장 커, 높은 정확도가 공정성을 의미하지는 않음을 보여주었다.
  • 랜덤 포레스트는 AUC와 변동성 모두 두 번째로 높은 성능를 보였고, 로지스틱 회귀는 가장 일관된 성능를 보이며 가장 낮은 변동성을 보였으며, 이는 정확도와 공정성 사이의 상충 관계를 시사한다.
  • 연구는 공정성이 모델 정확도에서 유추될 수 없으며, 공정성 임계값은 재학습 없이도 공정성을 향상시킬 수 있는 실용적인 사후 조치임을 결론 내린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.