Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning with A* and a Deep Heuristic

Ariel Keselman, S. Ten|arXiv (Cornell University)|2018. 11. 19.
Reinforcement Learning in Robotics참고 문헌 12인용 수 13
한 줄 요약

이 논문은 복잡한 환경에서 효율적으로 계획을 수행하기 위해 A* 탐색과 딥 네ural 네트워크 히우리스틱을 결합한 모델 기반 강화학습 알고리즘인 \aleph^{*}을 제안한다. 소프트 시간차분 업데이트를 통해 컨volutional 네ural 네트워크(CNN)를 학습시켜 액션 가치를 예측함으로써, \aleph^{*}는 픽셀 기반 주행 시뮬레이션에서 N-Step DQN에 비해 뛰어난 샘플 효율성과 성능을 달성한다. 수목은 높은 순차적 효율성(순서상 85%의 노드)을 보이며, 이론적 보상 상한선의 50%에 도달한다.

ABSTRACT

A* is a popular path-finding algorithm, but it can only be applied to those domains where a good heuristic function is known. Inspired by recent methods combining Deep Neural Networks (DNNs) and trees, this study demonstrates how to train a heuristic represented by a DNN and combine it with A*. This new algorithm which we call aleph-star can be used efficiently in domains where the input to the heuristic could be processed by a neural network. We compare aleph-star to N-Step Deep Q-Learning (DQN Mnih et al. 2013) in a driving simulation with pixel-based input, and demonstrate significantly better performance in this scenario.

연구 동기 및 목표

  • 알려진 히우리스틱이 없는 도메인에서 A*의 한계를 해결하기 위해 강화학습을 통해 딥 네럴 네트워크 히우리스틱을 학습하는 것.
  • 높은 차원의 관측 공간에서 효율적인 계획을 위해 학습된 히우리스틱을 활용하는 트리 탐색을 통한 모델 기반 강화학습 알고리즘 개발.
  • 픽셀 기반 입력이 있는 환경(예: 주행 시뮬레이션)에서 표준 DQN에 비해 샘플 효율성과 성능을 향상시키는 것.
  • 효과적인 히우리스틱 기반 탐색을 통해 얕고 높은 순차적 특성을 가진 수목을 구성함으로써 실시간 계획 수행 가능하게 하는 것.

제안 방법

  • 알고리즘은 누적 보상과 추정된 Q-값의 조합에 기반해 우선순위 큐를 사용하여 노드를 전개하며, 높은 보상과 높은 기대 수익을 가진 경로를 우선시한다.
  • 액션 가치는 소프트 시간차분 업데이트를 통해 叶 노드에서 루트까지 역전파되며, 이는 $ Q^{s}_{a} = r^{s}_{a} + \gamma \frac{\sum_{b\in{\mathcal{A}}} Q^{x}_{b} w^{x}_{b}}{\sum_{b\in{\mathcal{A}}} w^{x}_{b}} $로 정의된다. 이는 하드 최대값을 사용하는 것과 달리 액션 가치에 대해 스무딩을 적용한다.
  • 딥 컨volution 네ural 네트워크(CNN)는 원시 픽셀 관측을 처리하여 액션 가치를 예측하는 히우리스틱 함수 $ \mathcal{H}_{\theta} $로 기능한다.
  • 네트워크는 평균 제곱 오차 손실을 사용하여 학습된다: $ \mathcal{L} = \frac{\left|Q^{s} - \mathcal{H}_{\theta}(S(s))\right|^{2}}{\mathrm{len}(\mathcal{A})} $, 확률적 경사 하강법을 사용한다.
  • 완료된 수목에서 발생한 경험들은 리PLAY 버퍼에 저장되어 네트워크 가중치 업데이트에 사용되며, 지속적인 학습이 가능하다.
  • 시간 동역학(예: 속도, 조향)은 프레임 스택을 피하기 위해 직접 픽셀 색상에 인코딩되어 단일 프레임 관측에서부터 엔드 투 엔드 학습이 가능하다.

실험 결과

연구 질문

  • RQ1딥 네럴 네트워크 히우리스틱이 복잡하고 고차원적인 환경에서 효율적인 계획을 향상시키기 위해 효과적으로 학습되고 A* 탐색에 통합될 수 있는가?
  • RQ2학습된 딥 히우리스틱으로 향상된 A*의 성능은 픽셀 기반 제어 작업에서 표준 DQN에 비해 어떻게 비교되는가?
  • RQ3탐색 수목의 구조(예: 분기 수, 순차적 깊이)는 실시간 계획 실행 가능성에 얼마나 큰 영향을 미치는가?
  • RQ4표준 Q-학습 업데이트와 비교해 소프트 시간차분 업데이트가 학습 안정성과 성능 향상에 기여하는가?

주요 결과

  • \aleph^{*} 알고리즘은 주행 시뮬레이션에서 1000회 학습 반복 후 이론적 보상 상한선의 50%에 도달하여 효과적인 학습을 보였다.
  • 학습된 히우리스틱만을 사용한 경우 성능이 50% 감소했으며, 이는 전체 성능을 위해 수목 탐색이 필수적임을 시사한다.
  • N-Step DQN은 고도의 탐색($\epsilon = 1$)을 사용함에도 불구하고 동일한 환경에서 효과적으로 학습하지 못했으며, 이는 \aleph^{*}의 구조화된 탐색 방식의 우수성을 강조한다.
  • \aleph^{*} 수목의 구조는 높은 효율성을 보였으며, 약 85%의 노드가 거의 순차적인 경로를 형성하여 효율적인 실시간 계획 수행이 가능했다.
  • 우선순위 큐의 사용으로 알고리즘은 $\mathcal{O}(\text{rank})$로 확장되며, MCTS와 같은 롤아웃 기반 방법의 $\mathcal{O}(\text{rank}^2)$와 대비되어 큰 수목에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.