Skip to main content
QUICK REVIEW

[논문 리뷰] Floyd-Warshall Reinforcement Learning: Learning from Past Experiences to Reach New Goals

Vikas Dhiman, Shurjo Banerjee|arXiv (Cornell University)|2018. 09. 25.
Reinforcement Learning in Robotics참고 문헌 22인용 수 10
한 줄 요약

이 논문은 플로이드-워셜 최단경로 알고리즘에서 영감을 얻은 삼각부등식 제약 조건을 활용하는 모델리스 강화학습 알고리즘인 플로이드-워셜 강화학습(FWRL)을 제안한다. 이 제약 조건은 임의의 두 상태 사이의 최적 경로 가치가 중간 상태를 거쳐가는 간접 경로의 가치보다 낮지 않도록 보장하여, 동적 목표 간에 경험을 효율적으로 전이할 수 있도록 한다. 이를 통해 Q-러닝, 모델기반 강화학습 및 기준선 대비 높은 샘플 효율성과 더 나은 渐近 성능을 달성한다. 이는 표본화된 격자 환경에서의 다목적 강화학습 환경에서 입증되었다.

ABSTRACT

Consider mutli-goal tasks that involve static environments and dynamic goals. Examples of such tasks, such as goal-directed navigation and pick-and-place in robotics, abound. Two types of Reinforcement Learning (RL) algorithms are used for such tasks: model-free or model-based. Each of these approaches has limitations. Model-free RL struggles to transfer learned information when the goal location changes, but achieves high asymptotic accuracy in single goal tasks. Model-based RL can transfer learned information to new goal locations by retaining the explicitly learned state-dynamics, but is limited by the fact that small errors in modelling these dynamics accumulate over long-term planning. In this work, we improve upon the limitations of model-free RL in multi-goal domains. We do this by adapting the Floyd-Warshall algorithm for RL and call the adaptation Floyd-Warshall RL (FWRL). The proposed algorithm learns a goal-conditioned action-value function by constraining the value of the optimal path between any two states to be greater than or equal to the value of paths via intermediary states. Experimentally, we show that FWRL is more sample-efficient and learns higher reward strategies in multi-goal tasks as compared to Q-learning, model-based RL and other relevant baselines in a tabular domain.

연구 동기 및 목표

  • 다목적 작업에서 다양한 목표 위치 간 지식 전이에 실패하는 모델리스 강화학습의 한계를 해결하기 위해.
  • 표준 Q-러닝의 샘플 비효율성을 극복하기 위해 과거 트랙젝터리의 구조적 재사용을 활용함으로써 동적 목표 환경에서의 성능을 향상시키기 위해.
  • 명시적 모델 학습이나 재학습 없이도 과거 경험을 유지하고 일반화할 수 있는 방법을 개발하기 위해.
  • 표본화된 다목적 강화학습 작업에서 샘플 효율성과 渐近 성능을 향상시키기 위해.

제안 방법

  • FWRL은 목표 상태 $ s' $로의 상태 $ s $ 에서 행동 $ a $ 를 취했을 때의 누적 보상 기대값을 나타내는 목표 조건부 행동가치 함수 $ F_{\pi}^{*}(s'|s,a) $ 를 도입한다.
  • 핵심 혁신은 삼각부등식 제약 조건이다: $ F_{\pi^{*}_{s_j}}^{*}(s_j|s_i,a_i) \geq F_{\pi^{*}_{s_k}}^{*}(s_k|s_i,a_i) + \max_{a_k} F_{\pi^{*}_{s_j}}^{*}(s_j|s_k,a_k) $, 이는 중간 상태를 거쳐가는 경로의 최적성 전이를 보장한다.
  • 이 제약 조건은 목표에 도달하지 못한 과거 트랙젝터리들 간의 암묵적 통합과 일반화를 가능하게 하여, 새로운 시작-목표 쌍으로의 전이를 가능하게 한다.
  • FWRL은 FW 제약 조건을 적용한 표본화된 Q-러닝 스타일 업데이트를 사용하여 에피소드 간에 가치 함수를 반복적으로 개선한다.
  • 이 방법은 표준 및 바람이 있는 격자 환경에서 평가되었으며, Q-러닝, 목표를 연결한 Q-러닝(QLCAT), 모델기반 강화학습과 비교되었다.
  • 학습은 경험 재생을 사용하고 평가 시에는 탐색 없이 탐욕 정책 추론을 사용한다.

실험 결과

연구 질문

  • RQ1모델리스 강화학습 알고리즘이 정적 환경에서 다양한 목표 위치 간 지식 전이를 효과적으로 수행할 수 있는가?
  • RQ2플로이드-워셜 스타일의 전이 최적성 제약 조건을 강제할 경우, 다목적 작업에서 샘플 효율성과 성능이 어떻게 향상되는가?
  • RQ3표준 Q-러닝과 비교해 볼 때, FWRL은 목표에 도달하지 못한 과거 트랙젝터리로부터 얼마나 잘 일반화할 수 있는가?
  • RQ4표본화된 환경에서, FWRL은 모델리스 및 모델기반 기준선보다 보상과 거리 비효율성 측면에서 뛰어난 성능을 보일 수 있는가?

주요 결과

  • FWRL은 표준 및 바람이 있는 격자 환경에서 Q-러닝, QLCAT, 모델기반 강화학습과 비교해 일관되게 높은 평균 에피소드 보상 수준을 달성했다.
  • FWRL은 거리 비효율성이著격히 낮아져, 특히 복잡하거나 확률적인 환경에서 더 최적의 경로 선택을 함을 시사했다.
  • 보상 곡선에서 FWRL의 성능은 모든 기준선보다 더 빨리 상승했으며, 높은 보상 전략을 학습하는 데 있어 뛰어난 샘플 효율성을 보였다.
  • 정성적 테스트에서 FWRL은 새로운 시작 상태(다른 에피소드에서의 상태)에서 목표 상태로 최단 경로로 이동하는 데 성공했으며, QLCAT는 일반화 능력 부족으로 실패했다.
  • FWRL이 학습한 가치 함수는 상태 간에 일관되고 목표 중심적인 구조를 보였으며, 최적 가치가 중간 상태를 통해 명확하게 전파되는 모습을 보였다.
  • FWRL은 훈련 중에 관찰되지 않은 시작-목표 조합에서도 QLCAT를 능가하는 성능을 보였으며, 이는 훈련 중에 본 특정 트랙젝터리 외부로도 일반화할 수 있음을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.