[논문 리뷰] Distal Explanations for Explainable Reinforcement Learning Agents
이 논문은 강화학습을 위한 설명 가능 모델에서 원인 모델과 의사결정 트리, 순환 신경망을 통합하여 반사적 대체 조건과 기회 체인(예: 'A가 B를 가능하게 하고 B가 C를 유도함')을 생성하는 원거리 설명 모델을 제안한다. 이는 설명 가능한 강화학습을 위한 것이다. 6개의 강화학습 벤치마크와 90명의 참가자가 참여한 사용자 연구를 통해, 기존 기준 모델 대비 악성, 탐색 및 구조적, 협업 시나리오에서 작업 예측 정확도와 사용자 이해도를 향상시켰다.
Causal explanations present an intuitive way to understand the course of events through causal chains, and are widely accepted in cognitive science as the prominent model humans use for explanation. Importantly, causal models can generate opportunity chains, which take the form of `A enables B and B causes C'. We ground the notion of opportunity chains in human-agent experimental data, where we present participants with explanations from different models and ask them to provide their own explanations for agent behaviour. Results indicate that humans do in-fact use the concept of opportunity chains frequently for describing artificial agent behaviour. Recently, action influence models have been proposed to provide causal explanations for model-free reinforcement learning (RL). While these models can generate counterfactuals---things that did not happen but could have under different conditions---they lack the ability to generate explanations of opportunity chains. We introduce a distal explanation model that can analyse counterfactuals and opportunity chains using decision trees and causal models. We employ a recurrent neural network to learn opportunity chains and make use of decision trees to improve the accuracy of task prediction and the generated counterfactuals. We computationally evaluate the model in 6 RL benchmarks using different RL algorithms, and show that our model performs better in task prediction. We report on a study with 90 participants who receive explanations of RL agents behaviour in solving three scenarios: 1) Adversarial; 2) Search and rescue; and 3) Human-Agent collaborative scenarios. We investigate the participants' understanding of the agent through task prediction and their subjective satisfaction of the explanations and show that our distal explanation model results in improved outcomes over the three scenarios compared with two baseline explanation models.
연구 동기 및 목표
- 모델-프리 강화학습을 위한 기존 행동 영향 모델에서 기회 체인 설명의 부족을 해결하기 위해.
- 인간의 인지적 설명 패턴을 반영하는 원인 체인을 모델링하여 인간이 강화학습 에이전트 행동을 더 잘 이해할 수 있도록 하기 위해.
- 의사결정 트리와 순환 신경망을 사용하여 반사적 대체 조건 추론과 기회 체인 생성을 통합한 통합 프레임워크를 개발하기 위해.
- 다양한 강화학습 시나리오에서 계산적 벤치마크와 인간-중심 연구를 통해 모델의 효과성을 평가하기 위해.
제안 방법
- 모델은 순환 신경망을 사용하여 에이전트 행동 시퀀스에서 기회 체인을 학습하고 생성한다.
- 의사결정 트리를 적용하여 작업 예측를 정밀화하고 생성된 반사적 대체 조건의 정확도를 향상시킨다.
- 원인 모델을 통합하여 생성된 기회 체인 내 원인 관계를 분석하고 구조화한다.
- 반사적 대체 조건 생성과 기회 체인 모델링을 통합하여 더 직관적이고 인간 중심의 설명을 생성한다.
- 여러 강화학습 알고리즘을 사용하여 6개의 강화학습 벤치마크에서 계산적 평가를 수행하여 작업 예측 성능를 평가한다.
- 3가지 시나리오(악성, 탐색 및 구조적, 인간-에이전트 협업)에서 설명 품질을 평가하기 위해 90명의 참가자가 참여한 사용자 연구를 수행한다.
실험 결과
연구 질문
- RQ1기본적으로 'A가 B를 가능하게 하고 B가 C를 유도함'으로서 구성된 기회 체인은 인간이 강화학습 에이전트 행동을 설명하는 방식을 효과적으로 모델링할 수 있는가?
- RQ2기회 체인을 반사적 대체 조건 추론과 통합할 경우 강화학습 에이전트의 작업 예측 정확도는 어떻게 향상되는가?
- RQ3제안된 원거리 설명 모델은 기존 기준 설명 모델 대비 인간 사용자가 에이전트 행동을 이해하는 데에 더 효과적인가?
- RQ4다양한 강화학습 시나리오에서 사용자들이 제안된 모델의 설명을 얼마나 만족스럽고 유용하다고 느끼는가?
주요 결과
- 제안된 원거리 설명 모델은 기존 기준 모델 대비 6개의 강화학습 벤치마크에서 작업 예측 정확도를 크게 향상시켰다.
- 모든 3개의 시나리오에서 제안된 모델이 생성한 설명을 접한 참가자들이 기존 기준 모델 대비 더 높은 작업 예측 성능를 보였다.
- 사용자 연구에서 참가자들은 제안된 모델의 설명이 두 기준 모델 대비 더 높은 주관적 만족도를 보였다.
- 참가자들이 제공한 설명을 통해 검증된 바, 모델은 인간의 인지적 설명 패턴과 일치하는 기회 체인을 성공적으로 생성하였다.
- 의사결정 트리의 통합으로 인해 반사적 대체 조건 생성과 작업 예측의 정확도가 모두 향상되었다.
- 계산적 평가와 인간 평가 양 측면에서 기존 기준 모델 대비 우수한 성능을 보이며 다양한 강화학습 환경에서의 강건성을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.