Skip to main content
QUICK REVIEW

[논문 리뷰] DRLViz: Understanding Decisions and Memory in Deep Reinforcement Learning

Théo Jaunet, Romain Vuillemot|arXiv (Cornell University)|2019. 09. 06.
Explainable Artificial Intelligence (XAI)참고 문헌 68인용 수 36
한 줄 요약

DRLViz는 DRL 에이전트의 내부 메모리를 시각화된 메모리 타임라인, 행동, 입력 및 파생 지표를 통해 해석하는 시각 분석 인터페이스로, ViZDoom 네비게이션 작업에서 메모리 축소와 전문가 탐구를 가능하게 합니다.

ABSTRACT

We present DRLViz, a visual analytics interface to interpret the internal memory of an agent (e.g. a robot) trained using deep reinforcement learning. This memory is composed of large temporal vectors updated when the agent moves in an environment and is not trivial to understand due to the number of dimensions, dependencies to past vectors, spatial/temporal correlations, and co-correlation between dimensions. It is often referred to as a black box as only inputs (images) and outputs (actions) are intelligible for humans. Using DRLViz, experts are assisted to interpret decisions using memory reduction interactions, and to investigate the role of parts of the memory when errors have been made (e.g. wrong direction). We report on DRLViz applied in the context of video games simulators (ViZDoom) for a navigation scenario with item gathering tasks. We also report on experts evaluation using DRLViz, and applicability of DRLViz to other scenarios and navigation problems beyond simulation games, as well as its contribution to black box models interpretability and explainability in the field of visual analytics.

연구 동기 및 목표

  • DRL 에이전트의 내부 메모리를 설명하여 해석 가능성과 사후 분석을 지원합니다.
  • 의사 결정 분석을 위해 메모리를 탐색하고 필터링하며 축소하기 위한 인터랙티브 시각화를 제공합니다.
  • 시간과 공간에 걸쳐 메모리 다이나믹스를 에이전트의 결정, 입력 및 파생 지표와 연결합니다.
  • 도메인 전문가와 함께 접근 방식을 검증하고 시뮬레이션을 넘어선 탐색 작업에의 적용 가능성을 평가합니다.

제안 방법

  • RGB 입력과 128 차원의 GRU 메모리를 갖는 A2C 기반 DRL 모델을 사용합니다.
  • 시간(t steps) 동안 은닉상태 h_t를 기록하여 2D 히트맵 메모리 타임라인 형태의 메모리 매트를 구성합니다.
  • 메모리 타임라인, 2D 궤적 맵, 시간-스텝의 t-SNE, 파생 지표 등 여러 협력 시각화를 제공하여 메모리와 의사결정을 연결합니다.
  • 활성화, 변화, 안정적, 유사 등의 재정렬 기준과 메모리 간격 선택을 통해 메모리 축소 기법을 제공합니다.
  • 시뮬레이터 데이터에서 파생된 지표들(예: FoV 내 체력, FoV 내 아이템, 방향 변화, 의사결정 모호성)을 정의하여 메모리와 맥락적 정렬을 돕습니다.
  • 에피소드 기반 JSON 데이터(이미지, 행동 확률, 메모리 벡터 등)를 출력하는 데이터 파이프라인과 시각화를 위한 Flask+D3 프론트엔드를 구현합니다.

실험 결과

연구 질문

  • RQ1전문가들은 DRL 에이전트의 잠재 메모리와 의사결정 간의 연결을 어떻게 해석할 수 있을까요?
  • RQ2DRLViz가 시간과 공간에 걸쳐 특정 의사결정에 영향을 주는 어떤 메모리 요소를 식별하는 데 도움이 될 수 있을까요?
  • RQ3상호작용적 필터링 및 정렬을 통한 메모리 축소가 해석 가능성을 해치지 않으면서 의미 있는 패턴을 드러내나요?
  • RQ4파생 지표(예: FoV 내 아이템, 방향 변동)와 메모리 활성화 또는 의사결정 간에 어떤 관계가 도출되나요?

주요 결과

  • 전문가들은 메모리 타임라인과 행동 뷰를 사용해 에이전트가 반복적으로 회전하고 막다른 길에 이른 특정 구간을 식별할 수 있었습니다.
  • 은닉 상태 차원이 본 항목의 순서(예: 빨간 아머와 초록 아머)를 나타내는 시퀀스와 상관관계가 있었고 후속 단계에서도 활성 상태를 유지하는 것으로 관찰되었습니다.
  • 사용자들은 체력 팩이 처음 보였을 때도 활성 상태를 유지했고 수집까지 계속 활성 상태를 유지한 메모리 요소를 조사했습니다.
  • 살리언시 맵은 전문가가 에이전트가 무시한 입력(예: 핵심 아이템이 수집될 때까지 소울-스피어)을 이해하는 데 도움을 주었습니다.
  • t-SNE 클러스터는 목표에 정렬된 그룹화를 드러내었습니다(예: 녹색 아머를 모으는 전략 등), 은닉 상태 공간에 의미 있는 구조를 보여주었습니다.
  • 전반적으로 DRLViz는 DRL 메모리를 해석할 가능성을 보여주었고 ViZDoom를 넘어선 다른 시나리오에의 적용 가능성을 시사했습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.