[논문 리뷰] Interpretable-AI Policies using Evolutionary Nonlinear Decision Trees for Discrete Action Systems.
이 논문은 블랙박스 딥 강화학습(DRL) 정책을 단순하고 인간이 읽을 수 있는 규칙으로 풍미하기 위해 진화적 비선형 결정트리(NLDT)를 사용하는 해석 가능한 AI 정책을 제안한다. 이중 최적화 절차와 재최적화를 활용하여, DRL와 유사한 폐쇄 루프 성능를 달성하면서도 각 규칙당 비선형 항이 1~4개에 불과한 정책을 생성함으로써 성능을 희생시키지 않은 채 완전한 해석 가능성을 확보한다.
Black-box artificial intelligence (AI) induction methods such as deep reinforcement learning (DRL) are increasingly being used to find optimal policies for a given control task. Although policies represented using a black-box AI are capable of efficiently executing the underlying control task and achieving optimal closed-loop performance -- controlling the agent from initial time step until the successful termination of an episode, the developed control rules are often complex and neither interpretable nor explainable. In this paper, we use a recently proposed nonlinear decision-tree (NLDT) approach to find a hierarchical set of control rules in an attempt to maximize the open-loop performance for approximating and explaining the pre-trained black-box DRL (oracle) agent using the labelled state-action dataset. Recent advances in nonlinear optimization approaches using evolutionary computation facilitates finding a hierarchical set of nonlinear control rules as a function of state variables using a computationally fast bilevel optimization procedure at each node of the proposed NLDT. Additionally, we propose a re-optimization procedure for enhancing closed-loop performance of an already derived NLDT. We evaluate our proposed methodologies on four different control problems having two to four discrete actions. In all these problems our proposed approach is able to find simple and interpretable rules involving one to four non-linear terms per rule, while simultaneously achieving on par closed-loop performance when compared to a trained black-box DRL agent. The obtained results are inspiring as they suggest the replacement of complicated black-box DRL policies involving thousands of parameters (making them non-interpretable) with simple interpretable policies. Results are encouraging and motivating to pursue further applications of proposed approach in solving more complex control tasks.
연구 동기 및 목표
- 블랙박스 딥 강화학습(DRL) 정책의 해석 가능성 부족 문제를 해결하기 위해, 이는 종종 복잡하고 투명하지 못한 경우가 많다.
- 기존에 훈련된 DRL 오라클 에이전트의 행동을 근사하는 계층적인 해석 가능한 비선형 제어 규칙 세트를 개발하기 위해.
- 초기 규칙 추출 이후에 재최적화 절차를 통해 파생된 해석 가능한 정책의 폐쇄 루프 성능을 향상시키기 위해.
- 다양한 복잡도를 가진 이산 행동 제어 과제에서 방법을 평가하여 해석 가능성과 경쟁 가능한 성능를 모두 확보하기 위해.
제안 방법
- 상태 변수를 기반으로 비선형 결정 규칙의 계층적 구조로 제어 정책을 표현하기 위해 비선형 결정트리(NLDT) 아키텍처를 사용한다.
- 각 NLDT 노드에서 계산적으로 효율적인 이중 최적화 절차를 적용하여, 진화 계산과 비선형 최적화를 융합해 최적의 비선형 항을 학습한다.
- 사전에 훈련된 DRL 에이전트(오라클 정책)에서 추출한 상태-행동 쌍의 레이블링된 데이터셋을 사용해 NLDT를 훈련한다.
- 초기 규칙 추출 이후에 폐쇄 루프 성능 향상을 위해 NLDT 정책을 정교화하기 위해 재최적화 절차를 적용한다.
- 진화 계산을 활용해 복잡한 비선형 결정 경계를 탐색하면서도, 구조적인 트리 기반 규칙 표현을 통해 해석 가능성을 유지한다.
- 모델 복잡성과 성능를 균형 잡기 위해 각 규칙의 비선형 항 수를 1~4개로 제한하여 인간이 읽을 수 있도록 보장한다.
실험 결과
연구 질문
- RQ1진화 최적화를 통해 유도된 비선형 결정트리가 이산 행동 제어 과제에서 블랙박스 DRL 정책의 행동을 효과적으로 근사할 수 있는가?
- RQ2유도된 NLDT 정책가 원래 DRL 에이전트와 유사한 폐쇄 루프 성능를 유지하면서도 얼마나 해석 가능한가?
- RQ3제안된 재최적화 절차가 풍미된 NLDT 정책의 폐쇄 루프 성능 향상에 얼마나 효과적인가?
- RQ4이 방법이 이산 행동 수가 다양한 제어 문제(2~4개)에 대해 일반화되어 해석 가능성과 성능를 유지할 수 있는가?
주요 결과
- 제안된 NLDT 기반 정책는 평가된 네 가지 제어 문제 전반에서 원래 블랙박스 DRL 에이전트와 동등한 폐쇄 루프 성능를 달성한다.
- 풍미된 정책의 각 제어 규칙에는 비선형 항이 단지 1~4개뿐이므로, 수천 개의 파rameter를 가진 DRL 정책에 비해 해석 가능성 면에서 크게 향상되었다.
- 재최적화 절차는 NLDT 정책의 폐쇄 루프 성능 향상에 성공적으로 기여하여, 풍미된 정책를 정교화하는 데 효과적임을 입증한다.
- 이 방법은 복잡한 DRL 정책을 성능 손실 없이 단순하고 계층적이며 인간이 읽을 수 있는 결정 규칙으로 성공적으로 풍미한다.
- 결과는 비해석 가능한 DRL 정책을 실제 제어 응용 분야에서 해석 가능한 대안으로 대체할 수 있는 강력한 잠재력을 보여준다.
- 이 방법은 이산 행동 수가 2~4개인 문제들에 대해 효과적이며, 중간 정도의 복잡도를 가진 제어 과제로의 확장 가능성도 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.