Skip to main content
QUICK REVIEW

[논문 리뷰] ARES: Adaptive Receding-Horizon Synthesis of Optimal Plans

Anna Lukina, Lukas Esterle|arXiv (Cornell University)|2016. 12. 21.
Reinforcement Learning in Robotics참고 문헌 27인용 수 6
한 줄 요약

ARES는 수평 길이와 군집 크기를 동적으로 조정하는 Particle Swarm Optimization(PSO)를 사용하여 Markov Decision Processes(MDPs)에 대한 최적의 계획을 합성하는 적응형 후행-시간 알고리즘이다. Importance Splitting에서 영감을 받은 수준 기반의 도착 지점들을 활용하여 수렴을 보장하며, 평균 63초 내에 7마리의 새 무리에 대한 V-형성형 계획을 95% 성공률로 생성한다.

ABSTRACT

We introduce ARES, an efficient approximation algorithm for generating optimal plans (action sequences) that take an initial state of a Markov Decision Process (MDP) to a state whose cost is below a specified (convergence) threshold. ARES uses Particle Swarm Optimization, with adaptive sizing for both the receding horizon and the particle swarm. Inspired by Importance Splitting, the length of the horizon and the number of particles are chosen such that at least one particle reaches a next-level state, that is, a state where the cost decreases by a required delta from the previous-level state. The level relation on states and the plans constructed by ARES implicitly define a Lyapunov function and an optimal policy, respectively, both of which could be explicitly generated by applying ARES to all states of the MDP, up to some topological equivalence relation. We also assess the effectiveness of ARES by statistically evaluating its rate of success in generating optimal plans. The ARES algorithm resulted from our desire to clarify if flying in V-formation is a flocking policy that optimizes energy conservation, clear view, and velocity alignment. That is, we were interested to see if one could find optimal plans that bring a flock from an arbitrary initial state to a state exhibiting a single connected V-formation. For flocks with 7 birds, ARES is able to generate a plan that leads to a V-formation in 95% of the 8,000 random initial configurations within 63 seconds, on average. ARES can also be easily customized into a model-predictive controller (MPC) with an adaptive receding horizon and statistical guarantees of convergence. To the best of our knowledge, our adaptive-sizing approach is the first to provide convergence guarantees in receding-horizon techniques.

연구 동기 및 목표

  • 목표 비용 임계값에 수렴하는 최적의 동작 시퀀스를 합성하기 위한 확장 가능하고 적응적인 알고리즘 개발.
  • 고정된 수평 길이를 갖는 Model Predictive Control(MPC)의 한계를 해결하기 위해, 수렴 보장이 없고 창문 크기가 최적화되지 않은 문제를 해결.
  • Importance Splitting을 PSO와 통합하여 계층적 비용 수준을 통해 최적화를 이끌어내어 강력한 수렴 보장을 확보.
  • 새 무리나 드론 무리와 같은 복잡한 동적 시스템에 대해 실시간, 온라인 정책 합성 구현.
  • 수준 기반 상태 진행 방식을 통해 통계적 수렴 보장과 암묵적 리아푸노프 함수 구축 제공.

제안 방법

  • ARES는 비용 수준이 목표 임계값으로 향하는 내림차순으로 정렬된 상태 집합으로 구성된 수준 기반 후행-시간 프레임워크를 사용한다.
  • 다음 비용 수준에 도달하는 데 어려움이 있을수록 계획 수평 길이와 PSO의 입자 수를 적응적으로 증가시킨다.
  • 각 수준은 이전 수준에서 요구된 델타만큼 비용이 감소한 상태를 의미하며, 목표 향한 진전을 보장한다.
  • PSO는 각 수준에서 후보 동작 시퀀스를 생성하기 위해 적용되며, 적합도는 비용 감소에 의해 결정된다.
  • 이 방법은 수준 구조를 통해 암묵적인 리아푸노프 함수를 정의하고, 구성된 계획을 통해 최적의 정책을 정의한다.
  • ARES는 수평 길이와 군집 크기를 동적으로 조정하여 모델 예측 제어기로 전환할 수 있으며, 통계적 수렴 보장을 갖춘다.

실험 결과

연구 질문

  • RQ1사전에 최적의 수평 길이를 알지 못하는 상황에서, PSO를 활용한 적응형 후행-시간 접근이 MDP 계획에서 수렴을 보장할 수 있는가?
  • RQ2복잡한 MDP에서 효율성과 성공률의 균형을 맞추기 위해 계획 수평 길이와 입자 수를 어떻게 적응적으로 조정할 수 있는가?
  • RQ3Importance Splitting에서 유도된 수준 기반 도착 지점이 최적 계획 합성 중 局부 최소값을 피하는 데 PSO 성능을 향상시킬 수 있는가?
  • RQ4ARES는 새 무리나 드론 무리와 같은 실제 시스템에 대해 통계적 신뢰성으로 최적의 계획을 얼마나 잘 생성할 수 있는가?
  • RQ5ARES의 수준 기반 구조에서 암묵적인 리아푸노프 함수와 최적의 정책을 명시적으로 복원할 수 있는가?

주요 결과

  • 7마리의 새 무리에 대해, ARES는 8,000개의 무작위 초기 구성 중 95%에서 최적의 V-형성형 계획을 성공적으로 생성했다.
  • 계획당 평균 실행 시간은 단 63초였으며, 높은 계산 효율성을 보였다.
  • 비용 수준 진행에 기반한 적응형 수평 길이와 군집 크기 조정을 통해 ARES는 수렴 보장을 확보했다.
  • 수준 기반 구조는 암묵적인 리아푸노프 함수를 정의하여 저비용 상태로의 안정성과 수렴을 보장한다.
  • 고정된 수평 길이의 MPC보다 동적으로 계획 깊이와 입자 수를 조정하여 局부 최소값을 피할 수 있도록 성능을 뛰어나게 했다.
  • ARES는 통계적 수렴 보장을 갖는 실시간 모델 예측 제어기로 확장 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.