Skip to main content
QUICK REVIEW

[논문 리뷰] Interpretable and Fair Boolean Rule Sets via Column Generation

Connor Lawless, Sanjeeb Dash|arXiv (Cornell University)|2021. 11. 16.
Machine Learning and Data Classification참고 문헌 83인용 수 10
한 줄 요약

이 논문은 정수계획법을 활용한 컬럼 생성 기반 접근법을 제안하며, 정확도와 단순성에 최적화하면서도 공정성 제약 조건(등가 기회 및 등가된 기회)을 만족시키는 해석 가능하고 공정한 부울 규칙 집합을 디스junctional normal form(DNF)으로 학습한다. 이 방법은 16개 데이터셋 중 8개에서 세 가지 최신 기술보다 뛰어난 성능을 보이며, 정확도 손실를 최소화하면서도 공정성-정확도 트레이드오프를 향상시킨다.

ABSTRACT

This paper considers the learning of Boolean rules in disjunctive normal form (DNF, OR-of-ANDs, equivalent to decision rule sets) as an interpretable model for classification. An integer program is formulated to optimally trade classification accuracy for rule simplicity. We also consider the fairness setting and extend the formulation to include explicit constraints on two different measures of classification parity: equality of opportunity and equalized odds. Column generation (CG) is used to efficiently search over an exponential number of candidate rules without the need for heuristic rule mining. To handle large data sets, we propose an approximate CG algorithm using randomization. Compared to three recently proposed alternatives, the CG algorithm dominates the accuracy-simplicity trade-off in 8 out of 16 data sets. When maximized for accuracy, CG is competitive with rule learners designed for this purpose, sometimes finding significantly simpler solutions that are no less accurate. Compared to other fair and interpretable classifiers, our method is able to find rule sets that meet stricter notions of fairness with a modest trade-off in accuracy.

연구 동기 및 목표

  • 디스junctional normal form(DNF) 형태의 부울 규칙 집합을 사용하여 해석 가능하고 공정한 분류 모델을 개발한다.
  • 정수계획법을 통해 분류 정확도와 규칙 집합의 단순성 간의 트레이드오프를 최적화한다.
  • 특히 등가 기회 및 등가된 기회를 포함한 공정성 제약 조건을 규칙 학습 과정에 통합한다.
  • 히우리스틱 규칙 마이닝 없이 지수적 수의 후보 규칙을 효율적으로 탐색한다.
  • 이 맥락에서 0-1 분류 손실의 대체 목적 함수로 허밍 손실이 얼마나 효과적인지 평가한다.

제안 방법

  • 정확도와 규칙 집합의 복잡성 간의 트레이드오프를 최적화하기 위해 허밍 손실을 최소화하고 규칙 복잡도를 제약 조건으로 설정하는 혼합정수계획문(MIP)을 제안한다.
  • 모든 후보 규칙를 나열하지 않고도 고품질의 규칙를 동적으로 생성하기 위해 컬럼 생성(CG) 기법을 활용한다.
  • 각 CG 반복에서 가장 유망한 규칙를 식별하기 위해 정수계획문을 활용해 가격 설정 하위문제를 해결한다.
  • 계산 비용을 줄이기 위해 대규모 데이터셋에 대한 랜덤화된 근사 방식을 도입한다.
  • 등가 기회 및 등가된 기회에 대한 공정성 제약 조건을 MIP 수식에 통합한다.
  • 두 단계 접근법을 사용한다: 먼저 랜덤 포레스트에서 초기 규칙를 추출하고, 이후 초모수 튜닝을 통한 CG를 통해 규칙를 정밀 조정한다.

실험 결과

연구 질문

  • RQ1히우리스틱 규칙 마이닝 없이 컬럼 생성 기반 접근법이 효율적으로 작고 정확하며 공정한 DNF 규칙 집합을 학습시킬 수 있는가?
  • RQ2이 맥락에서 0-1 분류 손실의 대체 목적 함수로 허밍 손실이 얼마나 효과적인가?
  • RQ3기존의 해석 가능하고 공정한 분류기들보다 제안된 방법이 얼마나 더 나은 공정성-정확도 트레이드오프를 달성할 수 있는가?
  • RQ4데이터셋 크기에 따라 이 방법의 성능는 어떻게 변화하며, 대규모 문제에 대해 효과적인 근사 기법은 무엇인가?
  • RQ5명시적인 공정성 제약 조건이 규칙 집합의 복잡성과 모델 정확도에 어떤 영향을 미치는가?

주요 결과

  • 컬럼 생성 기반 방법은 16개의 표준 분류 데이터셋 중 8개에서 정확도-단순성 트레이드오프에서 세 가지 최근 규칙 학습기들을 압도적으로 뛰어넘었다.
  • 정확도를 극대화할 경우, 제안된 방법은 정확도를 유지하거나 향상시키면서도 경쟁 기법들보다 훨씬 단순한 규칙 집합을 생성하는 경향이 있었다.
  • 공정성 설정에서, 다른 공정한 분류기들과 비교해 정확도 손실이 미미한 수준이었음에도 불구하고 더 엄격한 공정성 제약 조건(낮은 불공정성)을 달성했다.
  • 모든 공정성 지표와 데이터셋에서 Fair CORELS 기준선은 제안된 Fair CG 방법에 의해 뛰어나졌으며, 더 낮은 불공정성과 더 높은 정확도를 기록했다.
  • 실제 적용에서는 허밍 손실이 효과적인 대체 목적 함수로 확인되었지만, 이론적으로는 0-1 손실과 항상 정확히 일치하지는 않음을 증명한 부정적 결과도 도출되었다.
  • 가격 설정 문제에 대한 랜덤화된 근사 방식은 대규모 데이터셋에서 확장 가능한 성능을 유지하면서도 경쟁 가능한 결과를 도출했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.