Skip to main content
QUICK REVIEW

[논문 리뷰] Hardware as Policy: Mechanical and Computational Co-Optimization using Deep Reinforcement Learning

Tianjian Chen, Zhanpeng He|arXiv (Cornell University)|2020. 08. 11.
Reinforcement Learning in Robotics참고 문헌 37인용 수 9
한 줄 요약

이 논문은 기계적 하드웨어와 계산적 제어 정책을 통합된 계산 그래프 내에서 미분 가능한 구성 요소로 모델링함으로써 하드웨어 및 제어 정책을 공동 최적화하는 딥 강화학습 프레임워크인 '하드웨어로서 정책(HWasP)'을 소개한다. 하드웨어 파라미터를 기반으로 한 기울기 기반 최적화를 가능하게 함으로써 HWasP는 초모수 튜닝과 진화 전략에 비해 더 빠른 수렴과 뛰어난 성능을 달성하였으며, 시뮬레이션된 질량- 스프링 시스템과 실제 3D 프린팅된 언더액티uated 손 모델을 통해 검증되었다. 이 손은 상자와 공에서 100% 성공률을 기록하였다.

ABSTRACT

Deep Reinforcement Learning (RL) has shown great success in learning complex control policies for a variety of applications in robotics. However, in most such cases, the hardware of the robot has been considered immutable, modeled as part of the environment. In this study, we explore the problem of learning hardware and control parameters together in a unified RL framework. To achieve this, we propose to model the robot body as a "hardware policy", analogous to and optimized jointly with its computational counterpart. We show that, by modeling such hardware policies as auto-differentiable computational graphs, the ensuing optimization problem can be solved efficiently by gradient-based algorithms from the Policy Optimization family. We present two such design examples: a toy mass-spring problem, and a real-world problem of designing an underactuated hand. We compare our method against traditional co-optimization approaches, and also demonstrate its effectiveness by building a physical prototype based on the learned hardware parameters. Videos and more details are available at https://roamlab.github.io/hwasp/ .

연구 동기 및 목표

  • 기존의 강화학습에서 하드웨어를 변화 불가능한 것으로 간주하는 한계를 해결하기 위해, 제어 정책만 학습되는 것을 방지한다.
  • 기울기 기반 방법을 사용하여 기계적 설계와 제어 정책을 공동 최적화함으로써 진화 전략의 샘플 비효율성 문제를 해결한다.
  • 하드웨어를 미분 가능한 정책으로 모델링함으로써 기계적 및 계산적 구성 요소의 효율적이고 확장 가능한 공동 설계가 가능하다는 것을 입증한다.
  • 간단한 기계 시스템과 실제 세계의 언더액티uated 손 프로토타입을 대상으로 이 접근법을 검증한다.
  • 표준 강화학습 툴킷을 사용하여 알고리즘 변경 최소화로 하드웨어와 소프트웨어의 공동 설계가 가능하도록 프레임워크를 구축한다.

제안 방법

  • 기어 비율, 스프링 강성 등의 하드웨어 파라미터는 신경망 가중치와 유사하게 기계적 계산 그래프 내에서 학습 가능한 파라미터로 통합된다.
  • 계산 정책과 하드웨어 정책을 모두 포함하는 전체 시스템은 기울기 기반 정책 학습 방법을 사용해 엔드 투 엔드로 훈련되며, 물리학에 부합하는 계산 그래프를 통해 기울기가 역전파된다.
  • 자동 미분 가능한 물리학 시뮬레이터를 활용하여 제어 및 하드웨어 파라미터에 대한 정책 성능 기울기를 계산한다.
  • 비미분 가능한 물리학 시뮬레이터에서도 작동하는 최소한의 변종(HWasP-Minimal)을 도입하여 분석 기울기 대신 샘플링 기반 기울기 기반 정책 기울기를 사용한다.
  • 단일 작업 및 다중 작업 최적화를 지원하며, 운동학, 형태, 센서 설계 등으로의 확장 가능성이 있다.
  • 하드웨어 파라미터를 정책 계산의 일부로 포함한 수정된 계산 그래프를 사용하여 표준 강화학습 알고리즘(PPO 등)을 평가한다.

실험 결과

연구 질문

  • RQ1기울기 기반 강화학습을 사용하여 제어 정책과 함께 하드웨어 파라미터를 효과적으로 최적화할 수 있는가?
  • RQ2기울기 기반 공동 최적화의 성능가 장기적인 초모수 튜닝 및 진화 전략에 비해 어떻게 비교되는가?
  • RQ3미분 가능한 물리학이 기계적 및 계산적 구성 요소의 공동 설계를 얼마나 더 빠르고 효율적으로 가능하게 하는가?
  • RQ4공동 최적화된 하드웨어 및 제어 정책이 시뮬레이션과 실제 세계에서 다양한 물체 형태와 抓취 작업에 일반화되는가?
  • RQ5물리학의 미분 가능성 포함이 공동 설계 과정의 확장성과 견고성에 어떤 영향을 미치는가?

주요 결과

  • HWasP는 질량-스프링 및 손 설계 작업 모두에서 초모수 튜닝과 기울기 없는 진화 전략에 비해 더 빠른 수렴과 높은 성능을 달성하였다.
  • HWasP 최적화된 하드웨어를 기반으로 한 3D 프린팅 언더액티uated 손의 물리적 프로토타입은 실제 실험에서 상자, 공, 실린더를 안정적으로 抓취하는 데 성공하였다.
  • Z-Grasp에서 상자와 공에 대해 100% 성공률, 실린더에 대해 90% 성공률를 기록하였으며, 3D-Grasp에서는 상자에 대해 100% 성공률, 실린더에 대해 80% 성공률를 달성하였다.
  • 3D-Grasp에서 공에 대해 50% 성공률를 기록한 것은 초기 접촉에 의한 물체 이동 문제로 인한 도전 과제를 보여주며, 실제 세계의 인식 문제를 암시한다.
  • 자동 미분 가능한 물리학이 없는 HWasP-Minimal은 샘플링 기반 기울기를 사용함에도 불구하고 최고의 진화 기반 베이스라인 수준 이상의 성능을 보였으며, 이는 비자동 미분 물리학 환경에서도 넓은 적용 가능성을 보여준다.
  • 이 프레임워크는 물리학의 미분 가능성 수준을 조정할 수 있도록 해주어 계산 비용과 구현 용이성 간의 균형을 유지하면서 효율적인 공동 설계를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.