Skip to main content
QUICK REVIEW

[논문 리뷰] Explaining Reinforcement Learning with Shapley Values

Daniel Beechey, Thomas M. S. Smith|arXiv (Cornell University)|2023. 06. 09.
Explainable Artificial Intelligence (XAI)인용 수 6
한 줄 요약

이 논문은 강화학습에서 개별 상태 특징의 기여도를 기반으로 에이전트 성능을 설명하기 위해 이론적으로 타당한 프레임워크인 SVERL(Shapley Values for Explaining Reinforcement Learning)을 소개한다. 정책 기반 특성 함수를 통해 특징 기여도를 모델링하고, 근사화를 위해 온맨포ลด(On-manifold) 샘플링을 활용함으로써, 다양한 환경에서 인간의 직관과 일치하는 직관적이고 정확한 설명을 도출한다.

ABSTRACT

For reinforcement learning systems to be widely adopted, their users must understand and trust them. We present a theoretical analysis of explaining reinforcement learning using Shapley values, following a principled approach from game theory for identifying the contribution of individual players to the outcome of a cooperative game. We call this general framework Shapley Values for Explaining Reinforcement Learning (SVERL). Our analysis exposes the limitations of earlier uses of Shapley values in reinforcement learning. We then develop an approach that uses Shapley values to explain agent performance. In a variety of domains, SVERL produces meaningful explanations that match and supplement human intuition.

연구 동기 및 목표

  • 딥 네ural 네트워크와 같은 함수 근사기법을 사용하는 고용량 강화학습 에이전트에 대해 원리적인 후행 해석 방법의 부족을 해결하기 위해.
  • 이전에 강화학습에서 셰플리 값을 적용할 때 자주 발생했던 이론적 결함을 식별하고 수정하기 위해.
  • 개별 상태 특징의 기여도를 예상 수익에 기여하는 정도로 정량화함으로써 에이전트 성능을 설명하는 새로운 프레임워크를 개발하기 위해.
  • 해석 방법이 게임 이론의 공정성 공리(axioms)를 만족하면서도 계산적으로 실현 가능하도록 보장하기 위해.
  • 수득된 해석이 인간의 직관과 일치하고 실생활 강화학습 응용에서의 해석 가능성 향상에 기여하는지 검증하기 위해.

제안 방법

  • 강화학습 해석 문제를 협동 게임으로 재정의하는 SVERL 프레임워크를 제안하며, 상태 특징을 플레이어로, 성능을 결과로 간주한다.
  • 특성 집합 $ C $ 에서만 가시적인 특징이 존재할 경우의 예상 수익을 특성 함수 $ v(C) $ 로 정의하며, 이때 전체 정책 행동은 해당 특징 집합에 조건화된다.
  • 표준 셰플리 값 공식 $ \phi_i(v) = \sum_{C \subseteq \mathcal{F} \setminus \{i\}} \frac{|C|!(|\mathcal{F}| - |C| - 1)!}{|\mathcal{F}|!} \cdot \delta(i, C) $ 을 사용하며, 여기서 $ \delta(i, C) $ 는 특징 $ i $ 가 연합 $ C $ 에 추가될 때의 마진널 이득이다.
  • 특정 특징 조합에 조건화된 상태 전이 샘플링을 통해 특성 함수 값을 근사하기 위해 온맨포ลด 샘플링을 적용한다.
  • 다양한 부분 관측 정책 하에서의 예상 수익을 추정하기 위해 몬테카를로 롤아웃을 활용하여 셰플리 값의 스케일러블한 계산을 가능하게 한다.
  • 특징 제거 시 정책 변화를 명시적으로 모델링함으로써 성능 영향을 정확히 기여도 할당하는 SVERL-P 를 도입한다.
Figure 2 : Top panel: Shapley values applied to a state-action value function in Gridworld-A ( Figure 1(a) ). Bottom panel: SVERL-P, presented in Section 4 , for the same domain. The optimal action is always North so we intuitively expect contributions to performance to be zero for all state feature
Figure 2 : Top panel: Shapley values applied to a state-action value function in Gridworld-A ( Figure 1(a) ). Bottom panel: SVERL-P, presented in Section 4 , for the same domain. The optimal action is always North so we intuitively expect contributions to performance to be zero for all state feature

실험 결과

연구 질문

  • RQ1셰플리 값을 강화학습 정책을 설명하는 데 정확하고 일관되게 적용하기 위해 이전의 이론적 오류를 피할 수 있는 방법은 무엇인가?
  • RQ2강화학습에서 가장 중요한 해석 대상은 무엇이며, 왜 에이전트 성능은 중요한데도 간과당하는가?
  • RQ3상태 특징에 기반한 셰플리 기반 설명이 인간 이해와 일치하는 직관적이고 의미 있는 통찰을 제공할 수 있는가?
  • RQ4실생활 강화학습 과제에서 흔히 발생하는 고차원 상태 공간에서 셰플리 값은 어떻게 효율적으로 근사할 수 있는가?
  • RQ5특징 기여도 할당은 강화학습 시스템의 신뢰도 향상, 디버깅 및 정책 설계에 실질적인 영향을 미칠 수 있는가?

주요 결과

  • SVERL은 셰플리 값의 공정성 공리를 만족하는 이론적으로 타당한 해석 프레임워크를 제공하며, 이전에 강화학습에서 잘못되거나 불완전하게 적용된 사례를 수정한다.
  • 특징 제거 시 정책 변화를 모델링하는 SVERL-P 는 그림판과 같은 도메인에서 정확하고 인간의 직관과 일치하는 해석을 도출한다.
  • 온맨포ลด 샘플링을 통한 근사 계산은 큰 상태 공간에서도 SVERL 의 실현 가능성을 보장하며, 지도학습에서와 유사한 수렴 보장을 갖는다.
  • 이 방법은 에이전트 성능에 가장 기여하는 상태 특징을 정확히 식별하여 정책 향상 및 디버깅을 위한 실질적인 통찰을 제공한다.
  • SVERL의 해석은 해석 가능하고 확장 가능하여 사용자가 특징의 역할에 대해 가설을 세울 수 있다—다만 이러한 가설은 경험적 검증이 필요하다.
  • 이 프레임워크는 기존의 셰플리 값 방법론의 발전(예: groupShapley)과도 호환되며, 스케일러블하고 그룹화된 특징 기여도 할당을 가능하게 한다.
Figure 3 : On the left: Shapley values applied to a state-value function in a Tic-Tac-Toe state. On the right: SVERL-P, presented in Section 4 , for the same state. Shapley values are represented using a color scale projected onto each cell. There are 9 state features, corresponding to each position
Figure 3 : On the left: Shapley values applied to a state-value function in a Tic-Tac-Toe state. On the right: SVERL-P, presented in Section 4 , for the same state. Shapley values are represented using a color scale projected onto each cell. There are 9 state features, corresponding to each position

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.