Skip to main content
QUICK REVIEW

[논문 리뷰] RL-LIM: Reinforcement Learning-based Locally Interpretable Modeling

Jinsung Yoon, Sercan Ö. Arık|arXiv (Cornell University)|2019. 09. 25.
Explainable Artificial Intelligence (XAI)참고 문헌 36인용 수 9
한 줄 요약

RL-LIM은 강화학습 기반의 방법으로, 최소한의 대표 샘플 집합을 선택하고, 블랙박스 모델 예측을 저용량, 인간이 읽을 수 있는 모델로 정제함으로써 국소적으로 해석 가능한 모델을 생성한다. 이 방법은 블랙박스 모델과 거의 동일한 예측 성능를 달성하면서도, 보상 기반 샘플 선택을 통해 기존 최고 수준의 방법들보다 해석 가능성과 충실도에서 뛰어난 성능을 발휘한다.

ABSTRACT

Understanding black-box machine learning models is important towards their widespread adoption. However, developing globally interpretable models that explain the behavior of the entire model is challenging. An alternative approach is to explain black-box models through explaining individual prediction using a locally interpretable model. In this paper, we propose a novel method for locally interpretable modeling - Reinforcement Learning-based Locally Interpretable Modeling (RL-LIM). RL-LIM employs reinforcement learning to select a small number of samples and distill the black-box model prediction into a low-capacity locally interpretable model. Training is guided with a reward that is obtained directly by measuring agreement of the predictions from the locally interpretable model with the black-box model. RL-LIM near-matches the overall prediction performance of black-box models while yielding human-like interpretability, and significantly outperforms state of the art locally interpretable models in terms of overall prediction performance and fidelity.

연구 동기 및 목표

  • 복잡한 블랙박스 기계학습 모델을 정확하고 인간이 이해할 수 있는 방식으로 해석하는 데 도전하는 것.
  • 원래 블랙박스 모델의 예측 성능를 유지하면서도 최소한의 데이터로 국소적 해석 가능한 모델을 생성하는 방법을 개발하는 것.
  • 강화학습을 통해 예측 충실도와 모델의 해석 가능성 양측을 향상시켜 기존 국소적 해석 가능한 모델을 개선하는 것.
  • 모델에 종속되지 않는 효율적이고 블랙박스 모델의 행동에 충실한 국소적 해석을 가능하게 하는 것.

제안 방법

  • 강화학습을 사용하여 주어진 인스턴스 주변에서 블랙박스 모델의 행동을 가장 잘 반영하는 소규모 대표 샘플 집합을 선택한다.
  • 선택된 샘플들에 기반해 저용량, 해석 가능한 모델을 훈련시어 블랙박스 모델의 국소적 예측을 근사한다.
  • 해석 가능한 모델의 예측과 블랙박스 모델의 출력 간 일치도를 측정하는 보상 신호에 의해 훈련 과정이 이끌린다.
  • RL 프레임워크 내 정책 네트워크는 최대 충실도와 최소 복잡도를 위해 샘플 선택을 최적화하는 데 학습한다.
  • 이 방법은 모델에 종속되지 않으며, 아키텍처 수정 없이도 어떤 블랙박스 모델에도 적용 가능하다.

실험 결과

연구 질문

  • RQ1강화학습이 국소적 모델 정제를 위해 최소한의 대표 샘플 집합을 효과적으로 식별할 수 있는가?
  • RQ2RL-LIM은 기존 최고 수준의 국소적 해석 가능한 모델들과 비교해 예측 충실도와 성능 측면에서 어떻게 다른가?
  • RQ3강화학습을 통해 훈련된 국소적 해석 가능한 모델이 원래 블랙박스 모델의 예측 정확도를 어느 정도 재현할 수 있는가?
  • RQ4보상 기반 샘플 선택 과정이 더 인간이 이해할 수 있고 충실도가 높은 국소적 해석을 이끌어내는가?

주요 결과

  • RL-LIM은 국소적 예측에서 원래 블랙박스 모델과 거의 구분되지 않는 예측 성능를 달성한다.
  • RL-LIM은 블랙박스 모델의 예측에 대한 충실도 측면에서 기존 최고 수준의 국소적 해석 가능한 모델들을 크게 능가한다.
  • RL-LIM가 생성한 국소적 해석 가능한 모델들은 작고도 매우 충실도가 높아 인간이 읽을 수 있는 해석이 가능하다.
  • 강화학습 기반 샘플 선택 과정은 예측 정확도를 유지하면서도 최소한의 데이터로 대표적인 인스턴스를 효과적으로 식별한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.