[논문 리뷰] In Pursuit of Interpretable, Fair and Accurate Machine Learning for Criminal Recidivism Prediction
이 논문은 블랙박스 모델과 기존 도구인 COMPAS 및 Arnold PSA에 비해 정확도를 유지하거나 초월하면서도 투명성과 공정성을 확보한 해석 가능한 기계학습 모델을 제안한다. 플로리다주와 켄터키주 데이터로 별도로 훈련된 이 모델들은 지역 간 일반화 능력이 떨어지며, 이는 지역별 모델 훈련과 정기적인 업데이트의 필요성을 시사한다.
Objectives: We study interpretable recidivism prediction using machine learning (ML) models and analyze performance in terms of prediction ability, sparsity, and fairness. Unlike previous works, this study trains interpretable models that output probabilities rather than binary predictions, and uses quantitative fairness definitions to assess the models. This study also examines whether models can generalize across geographic locations. Methods: We generated black-box and interpretable ML models on two different criminal recidivism datasets from Florida and Kentucky. We compared predictive performance and fairness of these models against two methods that are currently used in the justice system to predict pretrial recidivism: the Arnold PSA and COMPAS. We evaluated predictive performance of all models on predicting six different types of crime over two time spans. Results: Several interpretable ML models can predict recidivism as well as black-box ML models and are more accurate than COMPAS or the Arnold PSA. These models are potentially useful in practice. Similar to the Arnold PSA, some of these interpretable models can be written down as a simple table. Others can be displayed using a set of visualizations. Our geographic analysis indicates that ML models should be trained separately for separate locations and updated over time. We also present a fairness analysis for the interpretable models. Conclusions: Interpretable machine learning models can perform just as well as non-interpretable methods and currently-used risk assessment scales, in terms of both prediction accuracy and fairness. Machine learning models might be more accurate when trained separately for distinct locations and kept up-to-date.
연구 동기 및 목표
- 범죄 재범 예측에서 높은 예측 정확도를 유지하면서도 투명성과 공정성을 확보하는 해석 가능한 기계학습 모델을 개발하는 것.
- 해석 가능한 모델이 COMPAS 및 Arnold PSA와 같은 널리 사용되는 위험 평가 도구에 비해 정확도와 공정성 측면에서 뛰어나게 성능을 내는지 평가하는 것.
- 플로리다주와 켄터키주와 같은 다양한 지리적 지역 간에 재범 예측 모델의 일반화 능력을 조사하는 것.
- 인종 및 성별 하위군에서 현대적이고 정량적인 공정성 정의(예: 동일 기회, 예측 정합성)를 적용하여 모델의 행동을 평가하는 것.
- 법원에서 사용할 수 있도록 모델을 단순한 표 또는 시각화 자료로 제시할 수 있음을 입증함으로써 실무적 도입을 이끄는 것.
제안 방법
- 브로드캐스트 카운티, 플로리다주 및 켄터키주에서 두 개의 별도 데이터셋을 사용하여 블랙박스 모델과 해석 가능한 기계학습 모델을 훈련시켰다.
- 위험SLIM 알고리즘을 사용하여 희소하고 해석 가능한 모델을 생성하였으며, 이는 이진 예측이 아닌 확률을 출력한다.
- 6개의 범죄 유형(일般, 폭력, 약물, 재산, 중범죄, 경범죄)에 대해 6개월 및 2년의 시간 프레임에서 AUC 및 캘리브레이션 지표를 사용하여 모델 성능을 평가하였다.
- 인종 및 성별 하위군에서의 모델 행동을 평가하기 위해 정량적 공정성 정의(예: 동일 기회, 예측 정합성)를 적용하였다.
- 지역 간 성능을 비교하여 일반화 능력을 테스트하였으며, 한 지역에서 훈련된 모델이 다른 지역에 적용되었을 때 성능 저하가 심각하게 발생하는 것으로 나타났다.
- 인과적 추론과 데이터 분포 분석을 통해 모델이 지역 간 일반화되지 않는 이유를 설명하였으며, 연령 분포의 변화와 정책 영향을 주요 원인으로 지목하였다.
실험 결과
연구 질문
- RQ1해석 가능한 기계학습 모델이 블랙박스 모델과 현재 널리 사용되는 위험 평가 도구인 COMPAS 및 Arnold PSA와 동일한 예측 성능을 달성할 수 있는가?
- RQ2한 지역(예: 플로리다주)에서 훈련된 해석 가능한 모델이 다른 지역(예: 켄터키주)으로 일반화되는가, 아니면 지역별 훈련이 필수적인가?
- RQ3현대적 공정성 정의를 사용할 때 해석 가능한 모델이 인종 및 성별 하위군에서 어떻게 성능을 내는가?
- RQ4해석 가능한 모델이 단순한 표 또는 시각화 자료로 법원 관계자에게 효과적으로 전달될 수 있는가?
- RQ5데이터 분포의 시간적 및 지리적 변화가 재범 예측 모델의 장기적 유효성에 어떤 영향을 미치는가?
주요 결과
- 일부 해석 가능한 기계학습 모델이 블랙박스 모델과 동일한 예측 성능을 달성하거나 이를 초월하였으며, 해당 훈련 데이터셋에서 COMPAS 및 Arnold PSA보다 뚜렷이 뛰어난 성능을 보였다.
- 한 지역(예: 플로리다주 브로드캐스트 카운티)에서 훈련된 모델가 다른 지역(예: 켄터키주)에 적용되었을 때 성능이 크게 떨어지는 것으로 나타나 지역 간 일반화 능력이 열악한 것으로 확인되었다.
- 연구 결과, 데이터 분포—특히 연령 분포—가 1990년에서 2010년 사이에 크게 변화했으며, 이는 지역 간 및 시간 간 일반화 실패를 설명하는 데 기여할 수 있다.
- 해석 가능한 모델는 단 한 페이지 분량의 표나 시각화 자료로 표현 가능하여 법원에서의 사용에 적합하며, 투명성과 정의의 원칙을 강화할 수 있다.
- 공정성 분석 결과, 일부 해석 가능한 모델은 주요 공정성 기준(예: 동일 기회)을 충족했지만, 다른 모델들은 불균형을 보였으며, 이는 공정성 인식 모델 설계의 필요성을 강조한다.
- 결과적으로 지역별 모델 훈련과 정기적인 재훈련이 필요하며, 전국 수준의 모델(예: Arnold PSA)보다 주 수준의 모델이 더 뛰어난 성능을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.