Skip to main content
QUICK REVIEW

[논문 리뷰] A Survey on Interpretable Reinforcement Learning

Claire Glanois, Paul Weng|arXiv (Cornell University)|2021. 12. 24.
Explainable Artificial Intelligence (XAI)인용 수 15
한 줄 요약

이 종합 검토는 이해 가능한 강화학습(Interpretable Reinforcement Learning, IRL)에 대한 포괄적인 개요를 제공하며, 이해 가능한 입력, 이해 가능한 전이/보상 모델, 이해 가능한 의사결정을 세 가지로 분류한다. 이 문서는 사후 설명 가능성보다는 해석 가능성 자체를 인덕티브 바이어스로 강조하며, 2013–2021년 사이의 최근 발전을 검토하고, 확장성, 평가, 성능와의 상충관계와 같은 핵심 과제를 밝혀낸다.

ABSTRACT

Although deep reinforcement learning has become a promising machine learning approach for sequential decision-making problems, it is still not mature enough for high-stake domains such as autonomous driving or medical applications. In such contexts, a learned policy needs for instance to be interpretable, so that it can be inspected before any deployment (e.g., for safety and verifiability reasons). This survey provides an overview of various approaches to achieve higher interpretability in reinforcement learning (RL). To that aim, we distinguish interpretability (as a property of a model) and explainability (as a post-hoc operation, with the intervention of a proxy) and discuss them in the context of RL with an emphasis on the former notion. In particular, we argue that interpretable RL may embrace different facets: interpretable inputs, interpretable (transition/reward) models, and interpretable decision-making. Based on this scheme, we summarize and analyze recent work related to interpretable RL with an emphasis on papers published in the past 10 years. We also discuss briefly some related research areas and point to some potential promising research directions.

연구 동기 및 목표

  • 의료 및 자율주행과 같은 고위험 분야에 응용 가능한 딥 강화학습(DRL)에서의 해석 가능성에 대한 필수적인 요구를 해결하기 위해.
  • 해석 가능성(모델의 성질로서의 해석 가능성)과 설명 가능성(사후 작업으로서의 설명 가능성)을 구분하며, 강화학습에서 해석 가능성을 설계 원칙으로 삼는다.
  • 해석 가능한 입력, 해석 가능한 전이 및 선호 모델, 해석 가능한 의사결정을 세 축으로 하여 최근 IRL 방법을 체계적으로 분류하고 분석한다.
  • 해석 가능성을 일반화 능력, 데이터 효율성, 강건성 향상에 기여하는 정규화 기법으로서의 역할을 강조한다.
  • 평가 지표, 확장성, 해석 가능성과 성능 간의 상충관계와 같은 열린 문제들을 규명한다.

제안 방법

  • 입력, 전이/보상 모델, 의사결정 정책의 세 가지 구성요소를 기반으로 이해 가능한 RL의 분류 체계를 제안한다.
  • 구조적 표현, 기호 학습, 계층적 강화학습을 활용하여 입력의 해석 가능성을 향상시키는 방법을 조사한다.
  • 신경 기반 기호 방법 등을 활용해 이해 가능한 전이 모델(예: 보상 형태 조정을 위한)과 선호 모델을 학습하는 접근법을 검토한다.
  • 어텐션 메커니즘, 그래프 네트워크 등 아키텍처 인덕티브 바이어스와 지능형 해석 가능성 기반 정규화 기법을 검토하여 해석 가능성을 정책에 직접 통합한다.
  • 기호 정책 등 직접적(예: 기호 정책)과 모듈러 또는 계층적 접근 등 간접적(예: 모듈러 또는 계층적) 방법을 구분한다.
  • 다만 중심은 내재된 해석 가능성에 맞추어 사후 설명 가능성 기법에 대한 간략한 논의를 포함한다.

실험 결과

연구 질문

  • RQ1강화학습의 맥락에서 해석 가능성을 체계적으로 정의하고 설명 가능성과 어떻게 구분할 수 있는가?
  • RQ2강화학습에서 이해 가능한 입력을 달성하기 위한 주요 방법론적 접근은 무엇이며, 이러한 접근이 모델의 투명성을 어떻게 향상시키는가?
  • RQ3해석 가능한 전이 및 선호 모델은 모델 기반 강화학습의 투명성과 신뢰성에 어느 정도 기여할 수 있는가?
  • RQ4해석 가능한 의사결정 정책을 설계하기 위해 가장 효과적인 아키텍처 및 정규화 기법은 무엇인가?
  • RQ5해석 가능성 평가 및 강화학습에서 확장성과 성능 간의 균형을 맞추는 데 있어 주요 열린 과제는 무엇인가?

주요 결과

  • 안전, 책임성, 신뢰성과 관련된 윤리적, 법적, 운영적, 사용성 문제로 인해 고위험 응용 분야에서 이해 가능한 강화학습이 필수적이다.
  • 기호적 또는 구조적 표현과 같은 이해 가능한 입력은 모델의 투명성을 향상시키고, 부적절한 특징에 대한 의존도를 감소시킨다.
  • 해석 가능한 전이 및 선호 모델을 학습하면 모델 기반 강화학습에서 검증, 디버깅, 일반화 능력 향상에 기여한다.
  • 아키텍처 인덕티브 바이어스와 지능형 해석 가능성 기반 정규화 기법은 해석 가능성을 정책에 직접 통합하여 데이터 효율성과 강건성을 향상시킨다.
  • 완전히 해석 가능한 정책(예: 프로그램 유사)은 종종 NP-난이도를 가지므로, 해석 가능성과 확장성 사이에 상당한 상충관계가 존재한다.
  • 해석 가능성이나 설명 가능성에 대한 표준화된 평가 지표가 없어, 상호 비교 분석과 분야 내 발전을 저해하고 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.