[논문 리뷰] Optimization Methods for Interpretable Differentiable Decision Trees in Reinforcement Learning
이 논문은 온라인, 해석 가능한 정책 학습을 가능하게 하기 위해 정책 그래adier 강화학습을 통해 훈련되는 미분 가능한 결정 트리(DDT)를 소개한다. DDT는 딥 뉴럴 네트워크와 유사하거나 그 이상의 성능을 달성하면서도 인간이 읽을 수 있는 결정 정책을 제공함을 입증한다. 사용자 연구 결과, 배치 훈련된 트리보다 7배 높은 보상 수준을 기록했으며, 유의미한 해석 가능성 향상(p < 0.001)을 보였다.
Decision trees are ubiquitous in machine learning for their ease of use and interpretability. Yet, these models are not typically employed in reinforcement learning as they cannot be updated online via stochastic gradient descent. We overcome this limitation by allowing for a gradient update over the entire tree that improves sample complexity affords interpretable policy extraction. First, we include theoretical motivation on the need for policy-gradient learning by examining the properties of gradient descent over differentiable decision trees. Second, we demonstrate that our approach equals or outperforms a neural network on all domains and can learn discrete decision trees online with average rewards up to 7x higher than a batch-trained decision tree. Third, we conduct a user study to quantify the interpretability of a decision tree, rule list, and a neural network with statistically significant results ($p < 0.001$).
연구 동기 및 목표
- 강화학습에서 온라인, 해석 가능한 함수 근사기의 부족을 해결하기 위해 기울기 기반 훈련이 가능한 결정 트리의 가능성을 제시한다.
- 기울기 기반 경사 하강법을 통한 온라인 업데이트를 방해하는 표준 결정 트리의 비미분 가능성 문제를 해결한다.
- 미분 가능한 결정 트리가 표준 강화학습 벤치마크에서 딥 뉴럴 네트워크와 동등하거나 그 이상의 성능를 달성할 수 있음을 입증한다.
- 사람이 참여하는 의사결정 환경에서 DDT, 결정 목록, 신경망의 해석 가능성과 사용성 수준을 정량화한다.
- 강화학습에서 DDT를 훈련하기 위해 Q-학습 대비 정책 그래adier를 사용할 이론적 동기를 제공한다.
제안 방법
- 스위치 결정을 시그모이드 함수로 매개변수화하여 트리 구조 전반에 기울기 흐름을 가능하게 하는 미분 가능한 결정 트리(DDT) 아키텍처를 제안한다.
- 백프로파게이션을 통해 종단 간 온라인 업데이트가 가능한 기울기 기반 정책 그래adier 강화학습을 사용해 DDT를 훈련한다.
- 전체 모델에 대한 기울기 계산을 가능하게 하기 위해 트리를 통과하는 기대 보상을 계산하는 미분 가능한 소프트 라우팅 메커니즘을 사용한다.
- 훈련 후 이산적 프루닝 전략을 적용하여 훈련된 DDT에서 읽기 쉬운 딱딱한 결정 규칙을 추출한다.
- 실제 정책과 시뮬레이션된 의사결정 과제를 사용해 DDT, 결정 목록, 원-핫 MLP 간의 해석 가능성과 사용성에 대한 사용자 연구를 수행한다.
- MLP 가중치를 바이너리화하여 공정한 비교를 위한 단순화된 인간 독해 가능 버전을 생성한다.
실험 결과
연구 질문
- RQ1정책 그래adier 강화학습을 통해 미분 가능한 결정 트리를 효과적으로 훈련시켜 강화학습에서 온라인, 점진적 학습을 지원할 수 있는가?
- RQ2정책 그래adier로 훈련된 DDT의 성능가 표준 강화학습 환경에서 딥 뉴럴 네트워크와 비교해 어떻게 되는가?
- RQ3사람의 의사결정 과제에서 DDT와 결정 목록의 해석 가능성은 신경망보다 유의미하게 뛰어나게 되는가?
- RQ4DDT의 의사결정 과정은 신경망에 비해 인간에게 더 효율적이고 더 짜증을 유발하지 않는가?
- RQ5Q-학습과 정책 그래adier가 미분 가능한 결정 트리에 대해 최적화 역학에서 어떻게 다르며, 어떤 것이 훈련에 더 적합한가?
주요 결과
- 정책 그래adier로 훈련된 DDT는 동일한 환경에서 배치 훈련된 결정 트리보다 평균 보상 수준이 최대 7배 높았다.
- 정책 그래adier로 훈련된 DDT는 테스트된 모든 강화학습 도메인에서 딥 뉴럴 네트워크 기준선과 동등하거나 그 이상의 성능를 기록했다.
- 사용자 연구 결과, 결정 트리와 결정 목록은 원-핫 MLP보다 해석 가능성과 사용성에서 뚜렷하게 높은 평가를 받았다(p < 0.001).
- 참가자들은 DDT와 결정 목록을 사용할 때 단순화된 MLP를 사용할 때보다 의사결정 과제를 훨씬 더 빨리 완료했다(p < 0.001), 이는 높은 효율성을 의미한다.
- 연구 결과, 참가자들은 전체로 바이너리화되지 않은 MLP를 제공받으면 과제를 포기할 가능성이 높게 보고했으며, 이는 해석 가능한 모델과 투명하지 않은 블랙박스 모델 간의 사용성 격차를 드러낸다.
- 이론적 분석 결과, 정책 그래adier가 Q-학습보다 최적화 표면 특성이 유리하여 DDT 훈련에 더 안정적이고 적합하다는 것이 밝혀졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.