Skip to main content
QUICK REVIEW

[논문 리뷰] Model Selection's Disparate Impact in Real-World Deep Learning Applications

Jessica Zosa Forde, A. Feder Cooper|arXiv (Cornell University)|2021. 04. 01.
Artificial Intelligence in Healthcare and Education참고 문헌 30인용 수 9
한 줄 요약

이 논문은 딥러닝에서 모델 선택 과정이 전체 성능 지표가 안정된 상태에서도 인구 집단 간에 차별적 영향을 초래할 수 있음을 보여준다. ChestX-Ray8에서 CheXNet을 사용하여, 동일한 하이퍼파라미터로 훈련된 모델들 간에 남성과 여성 환자 간 진단 성능의 진짜 양성률(TPR)에 큰 변동이 있음을 입증하였으며, 이러한 격차는 최대 0.2892에 이르렀다. 이는 인간이 영향을 미치는 성능 지표 선택이 공정성 결과에 영향을 미칠 수 있음을 시사한다.

ABSTRACT

Algorithmic fairness has emphasized the role of biased data in automated decision outcomes. Recently, there has been a shift in attention to sources of bias that implicate fairness in other stages in the ML pipeline. We contend that one source of such bias, human preferences in model selection, remains under-explored in terms of its role in disparate impact across demographic groups. Using a deep learning model trained on real-world medical imaging data, we verify our claim empirically and argue that choice of metric for model comparison, especially those that do not take variability into account, can significantly bias model selection outcomes.

연구 동기 및 목표

  • 실제 딥러닝 응용 분야에서 인간이 영향을 미치는 모델 선택, 특히 성능 지표 선택 방식이 다양한 인구 집단 간에 차별적 영향을 초래할 수 있는 방식을 조사하는 것.
  • 동일한 하이퍼파라미터로 훈련되었지만 서로 다른 랜덤 시드를 사용한 모델들 간에 하위집단 성능(예: 남성 대 비율 여성 환자)의 변동성을 평가하는 것.
  • 전체 성능 지표(예: AUC)가 안정되어 있더라도 공정성을 보장하지는 않는다는 가정을 도전하는 것, 특히 의료 영상과 같은 고위험 분야에서의 적용을 고려하여.
  • 특히 실제 데이터셋에서의 공정성 평가에 있어 모델 선택 방식과 지표에 대한 더 큰 검토를 촉구하는 것.
  • 집단 성능을 총합 지표를 넘어서 고려하는 더 책임감 있고 투명하며 강력한 모델 선택 프로세스를 정착시키기 위한 것.

제안 방법

  • 고정된 ImageNet 미사전학습 가중치와 동일한 하이퍼파라미터를 사용하여 ChestX-Ray8 데이터셋에 대해 50개의 CheXNet 모델을 랜덤 시드만 변경하여 훈련시켰다.
  • 모든 실험에서 동일한 옵티마이저와 훈련 절차를 사용하였으며, 모델 간의 차이는 랜덤 시드에 따른 배치 셔플링에 기인하였다.
  • 각 모델에 대해, 저유병율 조건에서 재현율을 우선시하기 위해 훈련 세트에서 F1 점수를 최대화하는 예측 임계값을 선택하였다.
  • 남성 및 여성 테스트 서브셋에서 각 발견 결과별로 진짜 양성률(TPR)을 측정하여 하위집단 성능 격차를 평가하였다.
  • 모델 간의 전체 AUC와 TPR를 비교하여 다양한 인구 집단 간 성능 및 공정성의 일관성을 평가하였다.
  • 모델 간 남성과 여성 간 TPR 격차의 변동성을 분석하여 관찰된 최대 격차와 범위를 규명하였다.

실험 결과

연구 질문

  • RQ1특정 성능 지표(예: AUC)에 기반한 모델 선택이 다양한 인구 집단 간 하위집단 성능 격차를 얼마나 가리게 하는가?
  • RQ2동일한 하이퍼파라미터로 훈련되었지만 서로 다른 랜덤 시드를 사용한 여러 모델 간에 남성 및 여성 환자에 대한 진짜 양성률(TPR)의 변동성은 어느 정도인가?
  • RQ3전체 모델 성능(AUC)이 안정되어 있더라도, 하위집단 성능(예: 남성과 여성 간 TPR 격차)에 심각한 격차가 나타날 수 있는가?
  • RQ4모델 선택 지표의 선택이 특히 저유병율 의료 영상 작업에서 공정성 결과에 어떤 영향을 미치는가?
  • RQ5앙상블 또는 자동화된 방법을 통해 모델 선택 과정에서 하위집단 성능의 변동성을 얼마나 줄일 수 있는가?

주요 결과

  • 모델 간 AUC 값은 일관되게 유지되었음(예: Mass 발견에 대해 최대 범위 0.0227), 그러나 남성과 여성 간 진짜 양성률(TPR) 격차는 모델 간에 크게 변동하였다.
  • 어느 모델에서도 관찰된 남성과 여성 간 TPR 격차의 최대치는 0.2892에 이르렀으며, 이는 전체 성능이 안정되어 있더라도 심각한 공정성 리스크가 존재함을 시사한다.
  • 한 가지 발견에 대해 모델 간 TPR 격차의 범위는 최대 0.2258에 이르렀으며, 이는 모델 선택 방식이 공정성 문제를 증폭하거나 감소시킬 수 있음을 보여준다.
  • 하위집단 성능의 변동성은 전체 AUC와 상관관계가 없었으며, 이는 총합 지표가 공정성과 관련된 차이를 포착하지 못함을 의미한다.
  • 유사한 전체 성능을 보이는 모델들이 남성 및 여성 환자 하위집단에서 서로 다른 행동을 보였으며, 이는 총합 지표에만 기반해 모델을 배포할 경우 위험을 감수할 수 있음을 시사한다.
  • 이 연구는 모델 선택이 중립적인 과정이 아니라는 점을 드러내며, 인간의 지표 선택에 영향을 받는 선택이 데이터와 모델 아키텍처가 동일한 상태에서도 차별적 영향을 초래할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.