Skip to main content
QUICK REVIEW

[논문 리뷰] A Differentiable Physics Engine for Deep Learning in Robotics

Jonas Degrave, Michiel Hermans|arXiv (Cornell University)|2016. 11. 05.
Reinforcement Learning in Robotics인용 수 6
한 줄 요약

이 논문은 Theano 기반의 미분 가능 물리 엔진을 소개하며, 로봇 시뮬레이션을 통해 분석적 기울기 계산을 가능하게 하여 기울기 기반 방법을 사용한 복잡한 컨트롤러의 효율적 최적화를 가능하게 한다. 이는 물리 기반 역전파를 통해 파라미터 수가 수백만 개에 이르는 딥 뉴럴 네트워크 컨트롤러의 훈련 속도를 기존의 도함수 기반 최적화 방법 대비 최대 100배 빠르게 한다.

ABSTRACT

An important field in robotics is the optimization of controllers. Currently, robots are often treated as a black box in this optimization process, which is the reason why derivative-free optimization methods such as evolutionary algorithms or reinforcement learning are omnipresent. When gradient-based methods are used, models are kept small or rely on finite difference approximations for the Jacobian. This method quickly grows expensive with increasing numbers of parameters, such as found in deep learning. We propose the implementation of a modern physics engine, which can differentiate control parameters. This engine is implemented for both CPU and GPU. Firstly, this paper shows how such an engine speeds up the optimization process, even for small problems. Furthermore, it explains why this is an alternative approach to deep Q-learning, for using deep learning in robotics. Finally, we argue that this is a big step for deep learning in robotics, as it opens up new possibilities to optimize robots, both in hardware and software.

연구 동기 및 목표

  • 도함수 기반 최적화의 한계를 해결하기 위해 기울기 기반 학습을 통한 컨트롤러 최적화를 가능하게 한다.
  • 로봇 역학을 통해 분석적 기울기를 계산할 수 있는 미분 가능 물리 엔진을 개발하여 기존 시뮬레이터의 블랙박스 성격을 극복한다.
  • 미분 가능 물리 기반 기울기 최적화가 수백만 개의 파라미터를 가진 대규모 딥 러닝 컨트롤러에 대해서도 확장 가능하고 효율적임을 입증한다.
  • 미분 가능 시뮬레이션을 활용해 신경망 distillation, 하드웨어 파라미터 최적화, 적대적 로봇 훈련과 같은 새로운 응용 분야를 탐색한다.
  • 딥 러닝과 물리 기반 시뮬레이션을 통합한 계산 프레임워크를 제공하여 더 빠르고 강력한 로봇 정책 학습을 가능하게 한다.

제안 방법

  • Theano에서 계산 그래프로 구현된 3D 강체 물리 엔진을 완전히 새로 구축하여 자동 미분을 지원한다.
  • 접촉 및 제약 조건 해결을 위해 라인어 보완 문제(LCP)를 해결하기 위해 인파르 기반 속도 스텝과 가우스세이델 프로젝션을 사용한다.
  • 자동 미분에 호환되는 기본 연산의 제한된 집합을 사용하여 모든 물리적 연산을 미분 가능한 수학적 표현으로 표현함으로써 기울기 보존을 확보한다.
  • 충돌 검출에서 분기 구조를 피하기 위해 구형 물체만을 사용하여 Theano의 GPU 컴파일과의 호환성을 확보한다.
  • CPU 및 GPU 실행을 위한 계산 그래프를 컴iles하여 고성능 시뮬레이션과 기울기 계산을 가능하게 한다.
  • 컨트롤러 파라미터를 종합 최적화하기 위해 물리 엔진을 통해 역전파를 수행하여 딥 뉴럴 네트워크 컨트롤러를 훈련시킨다.

실험 결과

연구 질문

  • RQ1복잡하고 고차원적인 정책에 대해서도, 미분 가능 물리 엔진이 기울기 기반 최적화를 효율적으로 가능하게 할 수 있는가?
  • RQ2강화 학습이나 진화 알고리즘과 같은 도함수 기반 최적화 방법에 비해, 기울기 기반 최적화의 훈련 속도 및 수렴 성능는 어떠한가?
  • RQ3미분 가능 물리 기반 최적화를 통해 수백만 개의 파라미터를 가진 딥 뉴럴 네트워크 컨트롤러의 종합 학습이 얼마나 잘 가능할 수 있는가?
  • RQ4미분 가능 물리 기반 최적화를 통해 마찰 계수나 질량과 같은 물리 모델 파라미터의 최적화도 가능할 수 있는가?
  • RQ5물리 시뮬레이션을 통해 기울기가 제공될 경우, 적대적 훈련이나 지식 전이와 같은 새로운 학습 철학은 어떤 것이 가능해지는가?

주요 결과

  • 110만 개의 파라미터를 가진 컨트롤러에 대해, 기울기 기반 최적화를 통해 훈련 시간을 GPU 기준 311초에서 3.1초로 단 100배 빠르게 개선했다.
  • 1개의 로봇에 대해 1,296개의 파라미터를 가진 경우, CPU에서 기울기 계산에 8.17초, GPU에서 69.6초가 소요되어 기울기 평가가 가능하고 확장 가능함을 입증했다.
  • 128台의 로봇을 배치 처리한 경우, GPU에서 스텝당 시간이 1.01ms로 유지되어 기울기 계산을 수행함에도 불구하고 효율적인 병렬 최적화가 가능했다.
  • 물리 엔진을 통해 역전파를 수행함으로써, 수백만 개의 파라미터를 가진 딥 뉴럴 네트워크 컨트롤러의 종합 학습이 가능해졌으며, 강화 학습이나 진화 전략의 필요성을 회피할 수 있었다.
  • 미니멀한 물리 모델을 신경망에 전이하는 것, 하드웨어 파라미터 최적화, 적대적 로봇 훈련과 같은 향후 응용 분야를 지원한다.
  • 엔진의 기울기 가능성을 통해, 마찰 계수와 같이 상태에 따라 변하는 모델 파라미터를 학습된 신경망을 통해 효율적으로 최적화할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.