Skip to main content
QUICK REVIEW

[논문 리뷰] Adapting and Evaluating Influence-Estimation Methods for Gradient-Boosted Decision Trees

Jonathan Brophy, Zayd Hammoudeh|arXiv (Cornell University)|2022. 04. 30.
Explainable Artificial Intelligence (XAI)인용 수 10
한 줄 요약

이 논문은 딥러닝 영향 추정 기법—TracIn 및 리프레젠터 포인트 기법—을 그래디언트 부스팅 결정 트리(GBDTs)에 적용하여 BoostIn과 TREX를 제안한다. BoostIn은 떠나온 일괄 재학습(leave-one-out retraining) 대비 네 개 주기만큼 빠르며, 22개의 실세계 데이터셋에서 GBDT 모델에 대해 효율적이고 정확한 기여도 추정을 제공한다.

ABSTRACT

Influence estimation analyzes how changes to the training data can lead to different model predictions; this analysis can help us better understand these predictions, the models making those predictions, and the data sets they're trained on. However, most influence-estimation techniques are designed for deep learning models with continuous parameters. Gradient-boosted decision trees (GBDTs) are a powerful and widely-used class of models; however, these models are black boxes with opaque decision-making processes. In the pursuit of better understanding GBDT predictions and generally improving these models, we adapt recent and popular influence-estimation methods designed for deep learning models to GBDTs. Specifically, we adapt representer-point methods and TracIn, denoting our new methods TREX and BoostIn, respectively; source code is available at https://github.com/jjbrophy47/tree_influence. We compare these methods to LeafInfluence and other baselines using 5 different evaluation measures on 22 real-world data sets with 4 popular GBDT implementations. These experiments give us a comprehensive overview of how different approaches to influence estimation work in GBDT models. We find BoostIn is an efficient influence-estimation method for GBDTs that performs equally well or better than existing work while being four orders of magnitude faster. Our evaluation also suggests the gold-standard approach of leave-one-out (LOO) retraining consistently identifies the single-most influential training example but performs poorly at finding the most influential set of training examples for a given target prediction.

연구 동기 및 목표

  • 강력하지만 투명하지 않은 모델인 그래디언트 부스팅 결정 트리(GBDTs)에 대해 효율적이고 정확한 영향 추정 방법이 부족한 문제를 해결하기 위해.
  • 초기에는 딥러닝을 위해 설계된 영향 추정 기법을, 이산적이고 미분 불가능한 파라미터를 가진 GBDTs에 적용하기 위해.
  • 정량적이고 작업 의존적인 지표를 사용하여 실세계 GBDT 모델에 대해 여러 영향 추정 방법을 평가하고 비교하기 위해.
  • 모델 예측에 가장 영향을 미치는 학습 예제를 특정하고, 해당 예제를 제거하거나 수정했을 때 모델 성능에 미치는 영향을 평가하기 위해.
  • 런타임, 정확도, 데이터 편향에 대한 강건성 등을 포함한 영향 추정의 종합적 벤치마크를 제공하기 위해.

제안 방법

  • 강화 학습 라운드 동안 기울기 업데이트를 추적하여 TracIn이라는 동적 영향 추정 기법을 GBDTs에 적용함으로써 BoostIn을 도입한다.
  • 모델 예측을 학습 인스턴스에 대한 가중합으로 표현함으로써 리프레젠터 포인트 기법을 GBDTs에 적용하여 TREX를 도입한다.
  • 영향도 점수를 사용해 학습 예제를 순위 매기고, 상위 순위의 예제를 제거하거나 수정한 후 모델 성능을 평가한다.
  • 모든 방법을 기준으로 삼기 위해 떠나온 일괄 재학습(LOO retraining)을 영향 추정의 황금 표준으로 사용한다.
  • 손실, 정확도, AUC, 노이즈 추가 또는 레이블 수정 이후 성능 등의 다중 지표를 사용해 방법을 평가한다.
  • 네 가지 GBDT 구현체(XGBoost, LightGBM, CatBoost, Scikit-learn)와 22개의 실세계 데이터셋에서 영향도 점수를 계산한다.

실험 결과

연구 질문

  • RQ1딥러닝 기반 영향 추정 기법이 그래디언트 부스팅 결정 트리에 얼마나 일반화되는가?
  • RQ2TracIn 및 리프레젠터 포인트 기법의 변형이 기존 GBDT 영향 추정 방법보다 정확도와 효율성 면에서 뛰어나게 되는가?
  • RQ3모델 아키텍처, 데이터 유형(분류/회귀) 및 평가 지표에 따라 영향 추정 성능은 어떻게 달라지는가?
  • RQ4특히 단일 인스턴스가 아닌 집합에 대해 떠나온 일괄 재학습이 가장 신뢰할 수 있는 영향력 있는 학습 예제를 식별하는 데 여전히 최선의 방법인가?
  • RQ5다양한 방법 간의 영향도 점수는 얼마나 상관관계가 있으며, 이는 그들의 일관성과 신뢰성에 대해 어떤 의미를 갖는가?

주요 결과

  • 가장 영향력 있는 학습 예제를 제거한 후 테스트 손실을 최소화하는 데 BoostIn이 다른 모든 방법보다 뛰어나며, 데이터셋 평균 순위에서도 가장 높은 평균 순위를 기록한다.
  • BoostIn은 떠나온 일괄 재학습 대비 네 개 주기만큼 더 빠르며, 최소한의 계산 비용으로 유사하거나 더 뛰어난 성능을 달성한다.
  • TREX와 TreeSim은 특히 레이블 수정 작업에서 정확도와 AUC 향상에 뛰어난 성능을 보이며, 영향력 있는 예제를 제거한 후 성능 향상을 이룬다.
  • 떠내온 일괄 재학습은 항상 가장 영향력 있는 단일 학습 예제를 정확히 식별하지만, 가장 영향력 있는 예제 집합을 식별하는 데에는 실패한다.
  • 회귀 데이터셋에서는 서로 다른 방법 간의 영향도 점수 상관관계가 낮아, 평가 기준에 따라 방법에 따라 행동이 다름을 보이며, 일관성이 제한됨을 시사한다.
  • 자기 자신에 대한 영향도를 측정하는 BoostIn(self)는 레이블 수정 작업에서 경쟁적인 성능을 보이며, 잘못된 레이블 데이터를 식별하는 데 자기 영향도가 강력한 힌트가 될 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.