[논문 리뷰] Inherently Explainable Reinforcement Learning in Natural Language
이 논문은 텍스트 기반 게임을 위한 본질적으로 해석 가능한 강화학습 에이전트인 HEX-RL을 소개한다. 이 에이전트는 기호적 지식 그래프(KG)와 계층적 그래프 어텐션을 활용하여 즉각적인 단계별 자연어 설명과 장기적 의존성을 반영하는 후행적 시간적 확장 설명을 모두 생성한다. 인간 평가자들이 환경에 익숙하지 않은 상황에서 평가한 결과, 이 에이전트는 임의의 보조 기반 모델보다도 훨씬 뛰어난 설명 품질을 확보하면서도 최첨단 작업 성능을 달성하였다.
We focus on the task of creating a reinforcement learning agent that is inherently explainable -- with the ability to produce immediate local explanations by thinking out loud while performing a task and analyzing entire trajectories post-hoc to produce causal explanations. This Hierarchically Explainable Reinforcement Learning agent (HEX-RL), operates in Interactive Fictions, text-based game environments in which an agent perceives and acts upon the world using textual natural language. These games are usually structured as puzzles or quests with long-term dependencies in which an agent must complete a sequence of actions to succeed -- providing ideal environments in which to test an agent's ability to explain its actions. Our agent is designed to treat explainability as a first-class citizen, using an extracted symbolic knowledge graph-based state representation coupled with a Hierarchical Graph Attention mechanism that points to the facts in the internal graph representation that most influenced the choice of actions. Experiments show that this agent provides significantly improved explanations over strong baselines, as rated by human participants generally unfamiliar with the environment, while also matching state-of-the-art task performance.
연구 동기 및 목표
- 즉각적이고 단계별로 자연어로 설명할 수 있는 강화학습 에이전트를 개발하여, 작업 수행 중 및 이후에 인간이 이해할 수 있는 설명을 생성하는 것.
- 부분적으로 관찰 가능한 언어 기반 환경, 예를 들어 텍스트 기반 게임과 같은 환경에서 장기적 시점의 의사결정을 설명하는 과제를 해결하는 것.
- 기호적 지식 그래프 상태 표현을 딥 강화학습과 통합하여 인간이 이해할 수 있는 추론과 설명 생성을 가능하게 하는 것.
- 도메인에 익숙하지 않은 인간 평가자들을 통해 설명 품질을 평가하여, 설명이 직관적이며 신뢰할 수 있음을 보장하는 것.
- 강력한 기반 모델들에 비해 설명 품질을 크게 향상시키면서도 최첨단의 작업 성능를 유지하는 것.
제안 방법
- 에이전트는 탐색하면서 업데이트되는 동적이고 기호적인 지식 그래프(KG)를 유지하여 세계 상태, 즉 물체, 위치, 플레이어 인벤토리 및 관계를 인코딩한다.
- 행동 선택에 가장 영향을 미치는 하위 그래프를 식별하기 위해 KG에 계층적 그래프 어텐션 메커니즘을 적용함으로써 즉각적이고 국소적인 설명을 가능하게 한다.
- 시간적으로 확장된 설명을 위해, 에이전트는 후행적 경로 분석을 수행하여 장기적 의존성을 충족시키는 데 핵심적인 중간 상태와 행동을 식별한다.
- KG는 다양한 의미적 하위 그래프(예: 방 안의 물체, 플레이어 인벤토리, 위치 등)에 초점을 맞춘 계층적 어텐션 헤드를 갖는 그래프 어텐션 네트워크(GAT)로 인코딩된다.
- 행동 선택의 근거가 되는 KG의 특정 사실을 기반으로 설명을 생성하며, 어텐션 가중치를 사용해 관련 증거를 강조한다.
- 프레임워크는 zork1과 같은 인터랙티브 픽션 환경에서 평가되며, 에이전트-환경 상호작용을 위해 Jericho 프레임워크가 사용된다.
실험 결과
연구 질문
- RQ1강화학습 에이전트는 정확하고 인간이 이해할 수 있는 즉각적이고 단계별 자연어 설명을 생성할 수 있는가?
- RQ2동일한 에이전트는 작업 완료에 필수적인 장기적 의존성을 반영하는 시간적으로 확장된 설명을 생성할 수 있는가?
- RQ3기호적 지식 그래프와 계층적 어텐션을 통합하면 블랙박스 어텐션 메커니즘에 비해 설명 품질이 향상되는가?
- RQ4이러한 본질적으로 해석 가능한 에이전트는 복잡한 텍스트 기반 게임 환경에서 최첨단 성능을 유지할 수 있는가?
- RQ5인간 평가자들이 이 에이전트의 설명을 강력한 기반 모델의 설명보다 유의미하게 더 이해하기 쉬운 것으로 평가하는가?
주요 결과
- 게임 환경에 익숙하지 않은 참가자들이 HEX-RL이 생성한 설명을 강력한 기반 모델의 설명보다 유의미하게 더 이해하기 쉬운 것으로 평가하였다.
- 에이전트는 zork1과 같은 텍스트 기반 게임에서 최첨단의 작업 성능를 달성하였으며, 이전의 지식 그래프 기반 에이전트와 동등하거나 이를 초월하였다.
- 계층적 그래프 어텐션 메커니즘은 행동 선택에 영향을 미친 관련 하위 그래프를 성공적으로 식별하여 정밀하고 국소적인 설명을 가능하게 하였다.
- 후행적 경로 분석을 통해 핵심 중간 단계를 요약하는 시간적으로 확장된 설명을 생성할 수 있었으며, 예를 들어 나중에 사용하기 위해 조명을 일찍 들고 오는 것과 같은 의존성을 강조하였다.
- 기본 상태 표현으로 기호적이고 인간이 읽을 수 있는 지식 그래프를 사용함으로써 정확하고 해석 가능한 설명 생성이 가능했으며, 정책 성능에 손상을 주지 않았다.
- 평가 결과, 설명 가능성은 아키텍처의 초기 설계 단계부터 통합될 수 있으며, 후행적 레이어로 추가하는 것보다 더 신뢰할 수 있고 안정적인 설명을 얻을 수 있음을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.