Skip to main content
QUICK REVIEW

[논문 리뷰] Fairness in Machine Learning: A Survey

Simon Caton, Christian Haas|arXiv (Cornell University)|2020. 10. 04.
Ethics and Social Impacts of AI인용 수 129
한 줄 요약

본 고찰은 ML의 공정성에 대한 초보자용 개요를 제공하며, 접근법을 사전 처리(pre-processing), 사내 처리(in-processing), 사후 처리(post-processing)로 분류하고, 지표, 방법, 도구킷, 그리고 남은 과제에 대해 자세히 설명한다.

ABSTRACT

As Machine Learning technologies become increasingly used in contexts that affect citizens, companies as well as researchers need to be confident that their application of these methods will not have unexpected social implications, such as bias towards gender, ethnicity, and/or people with disabilities. There is significant literature on approaches to mitigate bias and promote fairness, yet the area is complex and hard to penetrate for newcomers to the domain. This article seeks to provide an overview of the different schools of thought and approaches to mitigating (social) biases and increase fairness in the Machine Learning literature. It organises approaches into the widely accepted framework of pre-processing, in-processing, and post-processing methods, subcategorizing into a further 11 method areas. Although much of the literature emphasizes binary classification, a discussion of fairness in regression, recommender systems, unsupervised learning, and natural language processing is also provided along with a selection of currently available open source libraries. The article concludes by summarising open challenges articulated as four dilemmas for fairness research.

연구 동기 및 목표

  • reader들에게 ML에서의 공정성의 핵심 개념과 역사에 소개한다.
  • 공정성 지표의 표준화와 그 트레이드-오프를 요약한다.
  • 사전 처리, 사내 처리, 사후 처리의 이차원 분류체계를 제시하고 비이항 작업으로 확장한다.
  • 법적 및 사회적 책임을 포함한 실무적 고려사항과 널리 사용되는 도구 키트들을 강조한다.
  • 향후 공정성 연구를 이끄는 네 가지 딜레마를 식별한다.

제안 방법

  • 공정성 기법을 사전 처리, 사내 처리, 사후 처리로 분류하는 통합 개입 프레임워크를 제시한다.
  • 다양한 공정성 지표(그룹, 개인, 반사실)의 범위를 공유 표기법으로 수록하고 대조한다.
  • 독립성(Independence), 분리(Separation), 충분성(Sufficiency) 같은 추상적 공정성 기준과 그 불가능성 결과를 논의한다.
  • 블라인딩, 인과 방법, 샘플링/하위집단 분석 등 방법군의 특성과 다양한 ML 단계에서의 적합성을 검토한다.
  • 데이터 대리 변수, 보호 변수, 그리고 잠재적인 법적/해석 가능성 함의를 다루는 실무적 고려사항을 개괄한다.
  • 가능한 오픈 소스 라이브러리를 요약하고 현재 연구 방향을 네 가지 미래 딜레마에 맵핑한다.

실험 결과

연구 질문

  • RQ1ML에서 공정성을 달성하기 위한 주요 방법론적 범주는 무엇이며, 데이터 및 모델 단계(사전 처리, 사내 처리, 사후 처리)와 어떻게 관련되는가?
  • RQ2이항 및 비이항 작업에서 서로 다른 공정성 지표를 어떻게 정의하고 해석하며 정확도와의 trade-off를 어떻게 반영하는가?
  • RQ3인과, 블라인딩, 샘플링 접근 방식의 작용 원리와 한계는 공정한 결과를 달성하는 데 어떤 영향을 미치는가?
  • RQ4현장 배치를 위한 공정 ML을 위한 실용적 도구와 남은 문제는 무엇인가?

주요 결과

  • 공정성에 대한 보편적 정의는 없으며, 여러 지표가 서로 다른 개념(통계적 동등성, 평균화된 오즈, 보정 등)을 포착하고 내재된 트레이드-오프를 가진다.
  • 사전 처리, 사내 처리, 사후 처리는 유연한 인터벤션 포인트를 제공하지만 모두가 보편적으로 비교 가능하지 않으며 각각 고유한 해석 가능성과 법적 함의를 가진다.
  • 연구는 그룹 공정성과 개인 공정성 사이의 긴장을 강조하며, 특정 조건에서 서로 상충하는 목표를 보이는 다수의 불가능성 결과를 보여준다.
  • 인과, 프록시 식별자, 그래프 기반 방법은 편향과 프록시를 식별하는 데 도움을 주지만 상당한 배경 정보가 필요하고 계산 비용이 많이 든다.
  • 오픈 소스 라이브러리의 수가 늘어나고 있지만 데이터 품질, 프록시 변수, 동적 데이터 시프트 등으로 실무 채택은 여전히 도전에 직면해 있다.
  • 연구자들은 접근성, 책임성, 사회적 영향에 초점을 맞춘 미래 연구를 이끄는 네 가지 딜레마를 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.