[논문 리뷰] A survey on datasets for fairness-aware machine learning
이 종합 조사에서는 정의 인식 기계 학습 연구에서 사용되는 표형 데이터셋에 대한 포괄적인 개요를 제공하며, 데이터셋의 구조, 베이지안 네트워크를 통한 편향 관계 분석, 정의성-성능 트레이드오���을 분석한다. 의료, 금융, 형사학 분야에서 주로 사용되는 핵심 데이터셋을 규명한 결과, 편향은 종종 데이터 자체에서 기인하며, 보호 대상 속성, 클래스 불균형, 대체 특성 등의 데이터셋 특성이 정의성 평가 결과에 결정적인 영향을 미친다.
As decision-making increasingly relies on Machine Learning (ML) and (big) data, the issue of fairness in data-driven Artificial Intelligence (AI) systems is receiving increasing attention from both research and industry. A large variety of fairness-aware machine learning solutions have been proposed which involve fairness-related interventions in the data, learning algorithms and/or model outputs. However, a vital part of proposing new approaches is evaluating them empirically on benchmark datasets that represent realistic and diverse settings. Therefore, in this paper, we overview real-world datasets used for fairness-aware machine learning. We focus on tabular data as the most common data representation for fairness-aware machine learning. We start our analysis by identifying relationships between the different attributes, particularly w.r.t. protected attributes and class attribute, using a Bayesian network. For a deeper understanding of bias in the datasets, we investigate the interesting relationships using exploratory analysis.
연구 동기 및 목표
- 정의 인식 기계 학습 연구에서 사용된 실제 표형 데이터셋을 체계적으로 수집하고 특성화하기.
- 보호 대상 속성, 클래스 레이블, 기타 특성 간의 관계를 베이지안 네트워크를 사용해 분석하여 숨겨진 편향 구조를 밝히기.
- 다양한 데이터셋 간 예측 성능 및 정의성 성능을 평가하여 모델 성능의 변동성을 부각하기.
- 기존 데이터셋의 격차를 규명하기, 예를 들어 오래된 데이터, 시간적/공간적 맥락 부족, 현대적 정의 개념의 표현 부족 등.
- 현재 사회적 및 기술적 과제를 반영하는 새로운 개방형 다각적 벤치마크 데이터셋 개발을 촉구하기.
제안 방법
- 최소 세 개 이상의 정의 관련 연구에서 사용된 데이터셋을 기준으로 인용 기반 기준을 적용해 동료 심사 논문에서 데이터셋을 수집.
- 특히 보호 대상 속성과 타겟 레이블 간의 조건부 의존성을 모델링하기 위해 베이지안 네트워크 학습 기법을 적용.
- 베이지안 네트워크의 구조를 바탕으로 탐색적 데이터 분석을 수행하여 보호 대상 및 대체 속성과 관련된 직접적 및 간접적 관계를 규명.
- 각 데이터셋에 대해 분류 모델의 정량적 평가를 수행하며, 정의성 메트릭(예: 인구 통계적 평등성, 동등 기회)과 예측 성능(예: 정확도, AUC)을 사용.
- 연구 목적에 맞는 데이터셋 선택을 지원하기 위해 응용 분야, 보호 대상 속성, 차원 수, 클래스 불균형, 정의성 과제 등 기준으로 데이터셋을 분류.
- 공개 저장소(예: UCI, Kaggle)를 활용하고, 비공개 또는 재현 불가능한 데이터셋은 제외하여 접근성과 재현 가능성을 확보.
실험 결과
연구 질문
- RQ1정의 인식 기계 학습 연구에서 가장 널리 사용되는 실제 표형 데이터셋은 무엇인가?
- RQ2이 데이터셋에서 보호 대상 속성은 타겟 레이블 및 기타 특성과 어떻게 관련되어 있으며, 대체 속성이 수행하는 역할은 무엇인가?
- RQ3클래스 불균형, 차원 수, 보호 대상 속성 수 등 데이터셋 특성이 정의성 및 예측 성능에 미치는 영향은 어느 정도인가?
- RQ4다양한 데이터셋 간 정의성 메트릭은 어떻게 변동하는가, 그리고 이는 알고리즘 평가에 어떤 함의를 갖는가?
- RQ5시간적 또는 분포 기반 정의성과 같은 현대적 정의 과제를 반영하지 못하는 기존 벤치마크 데이터셋의 주요 한계는 무엇인가?
주요 결과
- 1994년 미국 인구 조사 자료에서 유래한 Adult 데이터셋은 정의 인식 기계 학습 연구에서 가장 널리 사용되는 데이터셋으로, 45,000건 이상의 인스턴스와 14개의 특성을 포함한다.
- 베이지안 네트워크 분석을 통해 성별 및 인종과 같은 보호 대상 속성이 '결혼 상태', '직업', '국적' 등의 다수의 다른 특성과 조건부로 의존하는 것으로 나타나, 강력한 대체 관계가 있음을 확인했다.
- 재범 위험 예측에 사용된 COMPAS 데이터셋은 심각한 인종 편향을 보이며, 흑인 피고인은 백인 피고인보다 거의 두 배로 높은 위험도로 잘못 분류되는 경향이 있다.
- 60%의 조사 대상 데이터셋에서 클래스 불균형이 관찰되었으며, 독일 신용 데이터셋은 양호한 신용 신뢰도를 가진 신용 신청자 대비 나쁜 신용 신청자 비율이 2:1로 나타나, 정의성 문제를 악화시킬 수 있다.
- 정의성 메트릭은 데이터셋 간에 크게 차이가 났다: 인구 통계적 평등성은 독일 신용 데이터셋에서 0.12에서부터 ProPublica COMPAS 데이터셋에서 0.89까지 변동하여, 데이터셋에 따라 정의성 평가가 달라져야 함을 시사한다.
- 조사된 데이터셋의 평균 연령은 20년으로, 가장 오래된 데이터셋(SUPPORT)은 48년 전에 수집되었고, 가장 최신 데이터셋(KKBox)은 7년 전 자료였으며, 이는 현대적 기준에 맞는 최신 벤치마크가 필수적임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.