Skip to main content
QUICK REVIEW

[논문 리뷰] Scalable Planning with Tensorflow for Hybrid Nonlinear Domains

Ga Wu, Buser Say|arXiv (Cornell University)|2017. 04. 25.
Machine Learning and Algorithms참고 문헌 12인용 수 13
한 줄 요약

이 논문은 고차원 연속 행동 공간을 가진 하이브리드 비선형 도메인에서 확장 가능하고 GPU 가속 기반의 계획 수립을 위해 텐서플로우와 RMSProp 기반의 경사 하강법을 제안한다. 이 방법은 조각별 선형 도메인에서는 거의 최적의 성능를 달성하며, 비선형 도메인에서는 내부점 방법보다 뛰어나게 성능을 발휘한다. 대규모 동시 계획 문제에서 576,000개의 행동을 포함한 강력한 계획으로 수렴하는 데 4분 미만이 소요된다.

ABSTRACT

Given recent deep learning results that demonstrate the ability to effectively optimize high-dimensional non-convex functions with gradient descent optimization on GPUs, we ask in this paper whether symbolic gradient optimization tools such as Tensorflow can be effective for planning in hybrid (mixed discrete and continuous) nonlinear domains with high dimensional state and action spaces? To this end, we demonstrate that hybrid planning with Tensorflow and RMSProp gradient descent is competitive with mixed integer linear program (MILP) based optimization on piecewise linear planning domains (where we can compute optimal solutions) and substantially outperforms state-of-the-art interior point methods for nonlinear planning domains. Furthermore, we remark that Tensorflow is highly scalable, converging to a strong plan on a large-scale concurrent domain with a total of 576,000 continuous action parameters distributed over a horizon of 96 time steps and 100 parallel instances in only 4 minutes. We provide a number of insights that clarify such strong performance including observations that despite long horizons, RMSProp avoids both the vanishing and exploding gradient problems. Together these results suggest a new frontier for highly scalable planning in nonlinear hybrid domains by leveraging GPUs and the power of recent advances in gradient descent with highly optimized toolkits like Tensorflow.

연구 동기 및 목표

  • 기호적 경사 최적화 도구인 텐서플로우가 고차원 상태 및 행동 공간을 가진 하이브리드(이산-연속) 비선형 도메인에서 계획 수립을 효과적으로 수행할 수 있는지 조사하는 것.
  • HVAC, 저류지 제어, 항법과 같은 복잡한 실제 도메인에서 텐서플로우 기반 경사 하강법의 확장성과 성능을 평가하는 것.
  • RMSProp이 비선형 하이브리드 도메인에서 장기간의 계획 수평 동안 기울기 소실 및 폭발 문제를 효과적으로 방지할 수 있는지 확인하는 것.
  • 해결책의 품질과 계산 시간 측면에서 최신 기술의 계획 수립기들과 비교하여 제안된 방법의 성능을 평가하는 것.
  • 비볼록이고 고차원 도메인에서 딥러닝 최적화 툴킷을 기호적 계획 수립에 실용적으로 적용할 수 있는지 탐색하는 것.

제안 방법

  • 논문은 텐서플로우를 사용하여 하이브리드 비선형 계획 문제를 미분 가능 계산 그래프로 컴파일하여 시간에 따라 전파되는 역전파를 가능하게 한다.
  • 계획 목적함수를 연속 행동과 상태에 대한 미분 가능 비용 함수로 설정하며, 비선형 전이 및 보상 함수는 기호적 표현으로 코딩된다.
  • 비용 함수를 최소화하기 위해 RMSProp을 최적화 알고리즘으로 사용하며, 자동 미분과 GPU 가속을 활용한다.
  • 이 방법은 병렬 처리를 통해 여러 계획 인스턴스를 동시에 처리할 수 있어 확장성 향상에 기여한다.
  • 방법은 복잡도가 점점 증가하는 세 가지 도메인—항법, 저류지 제어, HVAC—에서 평가된다.
  • 수렴 속도와 해결 품질의 균형을 맞추기 위해 학습률 및 최적화 알고리즘 선택에 대한 하이퍼파rameter 튜닝을 수행한다.

실험 결과

연구 질문

  • RQ1텐서플로우 기반 경사 하강법과 RMSProp이 조각별 선형 하이브리드 계획 도메인에서 최적의 MILP 해법과 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2고차원 연속 행동 공간을 가진 비선형 하이브리드 계획 도메인에서 제안된 방법이 기존의 내부점 방법보다 뛰어난 성능을 발휘하는가?
  • RQ3RMSProp이 비선형 하이브리드 도메인에서 장기간의 계획 수평 동안 기울기 소실 및 폭발 문제를 효과적으로 방지할 수 있는가?
  • RQ4이 방법은 수십만 개의 연속 행동 파rameter를 포함하는 대규모 동시 계획 문제에 어떻게 확장되는가?
  • RQ5하이브리드 비선형 계획에서 학습률과 최적화 알고리즘 선택이 수렴 속도와 최종 해결 품질에 미치는 영향은 무엇인가?

주요 결과

  • 텐서플로우와 RMSProp은 조각별 선형 도메인에서 최적의 MILP 해법과 경쟁 가능한 성능를 보이며, 비볼록 함수에 대해서도 거의 최적임을 시사한다.
  • 비선형 도메인에서는 MATLAB의 fmincon 내부점 솔버보다 뚜렷이 뛰어난 성능를 보이며, 수백 배 빠른 시간에 비슷하거나 더 나은 해결책을 도출한다.
  • GPU에서 100개의 병렬 인스턴스와 96개의 시간 단계를 포함한 576,000개의 연속 행동 파rameter를 가진 강력한 계획으로 수렴하는 데 4분 미만이 소요된다.
  • 실험 결과에 따르면 RMSProp은 장기간의 수평 동안 기울기 소실 및 폭발 문제를 효과적으로 방지하며, 안정적이고 점진적인 수렴을 보였다.
  • HVAC 도메인에서 최적의 학습률은 0.01로 확인되었으며, 이는 수렴 속도와 높은 해결 품질을 균형 잡는 데 유리하다. 반면 0.001과 같은 낮은 학습률은 실용적인 사용에 적합하지 않을 정도로 너무 느리게 수렴했다.
  • 표준 최적화 알고리즘 중에서 RMSProp이 가장 빠른 수렴 속도와 가장 뛰어난 성능를 보였으며, 기울기 소실 문제로 인해 성능이 저하되는 아달그레드 및 아다델타보다 뛰어났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.