Skip to main content
QUICK REVIEW

[논문 리뷰] Complementary reinforcement learning towards explainable agents

Jung H. Lee|arXiv (Cornell University)|2019. 01. 01.
Explainable Artificial Intelligence (XAI)참고 문헌 33인용 수 6
한 줄 요약

이 논문은 심층 강화학습(RL) 에이전트의 행동에서 학습하는 퀼리심볼릭(QS) 에이전트를 제안하며, 투명하고 규칙 기반의 의사결정 시스템을 구축한다. 높은 가치를 지닌 상태 전이('허브 상태')를 식별하고 단순한 매칭 및 값 네트워크를 사용함으로써, 원래의 RL 에이전트와 유사한 성능을 달성하면서도 해석 가능하고 수정 가능하며 수리 가능한 의사결정을 가능하게 한다. 이는 고위험 응용 분야에서 설명 가능한 인공지능으로 향하는 길을 제시한다.

ABSTRACT

Reinforcement learning (RL) algorithms allow agents to learn skills and strategies to perform complex tasks without detailed instructions or expensive labelled training examples. That is, RL agents can learn, as we learn. Given the importance of learning in our intelligence, RL has been thought to be one of key components to general artificial intelligence, and recent breakthroughs in deep reinforcement learning suggest that neural networks (NN) are natural platforms for RL agents. However, despite the efficiency and versatility of NN-based RL agents, their decision-making remains incomprehensible, reducing their utilities. To deploy RL into a wider range of applications, it is imperative to develop explainable NN-based RL agents. Here, we propose a method to derive a secondary comprehensible agent from a NN-based RL agent, whose decision-makings are based on simple rules. Our empirical evaluation of this secondary agent's performance supports the possibility of building a comprehensible and transparent agent using a NN-based RL agent.

연구 동기 및 목표

  • 심층 강화학습(RL) 에이전트의 투명성 부족 문제를 해결함으로써, 의료 및 자율주행과 같은 고위험 분야에서의 적용을 제한하는 문제를 해결한다.
  • 복잡한 블랙박스 RL 에이전트의 의사결정을 해석하고 재현할 수 있는 보조적이고 이해하기 쉬운 에이전트를 개발한다.
  • 투명하고 규칙 기반의 메커니즘을 통해 수동 보정 및 점진적 향상을 가능하게 한다.
  • 복잡한 과제에서 심층 RL 에이전트의 성능을 따라할 수 있는 단순하고 해석 가능한 에이전트가 가능한지 탐색한다.

제안 방법

  • QS 에이전트는 상태 전이($\Delta S$)와 관련된 누적 보상을 저장하고 검색하기 위해 값 네트워크를 사용하며, 이를 학습된 값으로 간주한다.
  • 매칭 네트워크는 코사인 유사도를 사용하여 현재 상태 전이와 가장 유사한 저장된 전이($\Delta S$)를 식별하고, 가장 높은 값의 매칭을 기반으로 최적의 동작을 선택한다.
  • 에이전트는 효과적인 정책의 핵심이 되는 고가치 전이인 '허브 상태'를 식별하고, 행동 계획을 통해 이를 우선순위로 삼는다.
  • 허브 상태로의 유효한 경로를 찾을 수 없는 경우, 에이전트는 즉각적인 전이 값이 가장 높은 동작을 선택한다.
  • 시스템은 모듈러하고 독립적인 구성 요소(매칭 노드 및 값 네트워크)로 설계되어 있어, 특정 상태-전이 규칙의 수동 추가, 제거 또는 수정이 가능하다.
  • 방법은 OpenAI Gym의 'lunar-lander' 환경을 사용하여 평가되었으며, QS 에이전트 성능을 원래의 RL 에이전트와 비교하였다.

실험 결과

연구 질문

  • RQ1복잡한 블랙박스 RL 에이전트의 성능을 재현하면서도 의사결정 과정의 완전한 투명성을 유지할 수 있는 보조적 규칙 기반 에이전트를 훈련시킬 수 있는가?
  • RQ2복잡하고 블랙박스인 RL 에이전트의 의사결정 과정을 인간 분석이 가능한 단순하고 해석 가능한 규칙 집합으로 압축할 수 있는가?
  • RQ3에이전트의 행동이 내부 규칙에 대한 수동 간섭을 통해 점진적으로 보정되거나 향상될 수 있는 시스템을 구축할 수 있는가?
  • RQ4연속 제어 벤치마크에서 투명한 퀼리심볼릭 에이전트의 성능는 심층 RL 에이전트와 어떻게 비교되는가?

주요 결과

  • quilisymbolic(QS) 에이전트는 lunar-lander 환경에서 원래의 심층 강화학습 에이전트와 유사한 성능를 달성하여, 투명한 에이전트가 복잡한 RL 성능를 따라할 수 있음을 입증하였다.
  • QS 에이전트의 의사결정 과정은 간단하고 모듈러한 아키텍처 덕분에 완전히 투명하며, 독립적인 매칭 및 값 네트워크는 수동으로 분석하거나 수정할 수 있다.
  • 시스템은 점진적 개선을 가능하게 하며, 성능가능성이 떨어지거나 안전하지 않은 상태-전이 규칙는 제거하고, 새로운 유용한 전이를 추가함으로써 기존 功能을 훼손하지 않고도 개선이 가능하다.
  • QS 에이전트는 '허브 상태'를 성공적으로 식별하고 우선순위를 정함으로써, RL 행동으로부터 학습하고 일반화할 수 있음을 입증하였다. 이는 효과적인 정책의 기반을 형성하는 핵심 전이이다.
  • 값 네트워크는 전이 값의 저장 및 검색을 효과적으로 수행하였고, 매칭 네트워크는 이전에 관찰된 고가치 전이와의 유사도를 기반으로 가장 적절한 동작을 신뢰성 있게 선택하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.