Skip to main content
QUICK REVIEW

[논문 리뷰] OptLayer - Practical Constrained Optimization for Deep Reinforcement Learning in the Real World

Tu-Hoa Pham, Giovanni De Magistris|arXiv (Cornell University)|2017. 09. 22.
Reinforcement Learning in Robotics참고 문헌 13인용 수 11
한 줄 요약

OptLayer는 안전하지 않은 신경망 예측을 타당하고 안전한 로봇 동작으로 변환하는 미분 가능한 제약 최적화 레이어를 도입하여 실세계에서 안전한 딥 강화학습을 가능하게 한다. TRPO와 통합함으로써 더 빠르고 안전한 학습을 달성하였으며, 제약이 없는 학습 대비 최대 38% 감소된 에피소드 수를 요구하면서도 시뮬레이션 및 실세계 로봇 조작 작업 전반에서 충돌 회피를 보장하였다.

ABSTRACT

While deep reinforcement learning techniques have recently produced considerable achievements on many decision-making problems, their use in robotics has largely been limited to simulated worlds or restricted motions, since unconstrained trial-and-error interactions in the real world can have undesirable consequences for the robot or its environment. To overcome such limitations, we propose a novel reinforcement learning architecture, OptLayer, that takes as inputs possibly unsafe actions predicted by a neural network and outputs the closest actions that satisfy chosen constraints. While learning control policies often requires carefully crafted rewards and penalties while exploring the range of possible actions, OptLayer ensures that only safe actions are actually executed and unsafe predictions are penalized during training. We demonstrate the effectiveness of our approach on robot reaching tasks, both simulated and in the real world.

연구 동기 및 목표

  • 로봇 분야의 실세계 딥 강화학습에서 안전하지 않은 탐색 및 실행이라는 핵심 과제를 해결하기 위해.
  • 전문가 지시나 보상 형상 조정에 의존하지 않고도 명시적인 안전 제약 조건 하에서 신경망 정책의 엔드 투 엔드 훈련을 가능하게 하기 위해.
  • 학습 중 안전하지 않은 예측을 효율적으로 활용하면서도 실행 시에는 오직 안전한 동작만이 수행되도록 하여 학습 속도를 높이기 위해.
  • 실제 산업용 로봇에서 직접 복잡한 3D 도달 및 장애물 회피 정책을 학습하는 것이 가능함을 입증하기 위해.

제안 방법

  • 사용자가 정의한 제약 조건을 만족하는 최적의 타당 동작로의 변환을 가능하게 하는, 비가역적인 최적화 레이어인 OptLayer를 도입한다.
  • 충돌 회피나 관절 한계 등의 안전 제약 조건으로 정의된 타당 집합 위로 동작를 투영하기 위해 제약 최적화 공식을 사용한다.
  • 두 단계 훈련 전략을 활용한다: 먼저 원래의 안전하지 않은 예측을 사용해 정책을 업데이트하고, 이후 제약된 동작을 사용해 정책를 보완함으로써 샘플 효율성을 향상시킨다.
  • Trust-Region Policy Optimization (TRPO)와 OptLayer를 통합하여 제약 레이어를 관통한 엔드 투 엔드 역전파를 가능하게 한다.
  • 학습 중에는 안전하지 않은 예측에 대해 보상을 감산하고, 추론 시에는 오직 안전한 동작만 실행되도록 보장하는 보상 전략을 구현한다.
  • 정적 및 동적 장애물을 포함한 3D 로봇 도달 작업에 대해 시뮬레이션 및 실제 산업용 조작자에서 이 방법을 적용한다.

실험 결과

연구 질문

  • RQ1미분 가능한 제약 최적화 레이어가 실세계 로봇 분야의 안전한 동작 실행을 위해 딥 강화학습에 효과적으로 통합될 수 있는가?
  • RQ2안전 제약이 있는 강화학습에서 OptLayer는 제약이 없는 또는 보상 기반 접근법에 비해 샘플 효율성과 학습 속도를 어떻게 향상시키는가?
  • RQ3OptLayer로 학습된 정책는 재학습 없이도 이질적인 환경 변화, 예를 들어 이동하는 장애물이나 목표물에 대해 얼마나 잘 일반화되는가?
  • RQ4OptLayer는 전문가 지시나 광범위한 시뮬레이션 없이도 실세계에서 제로부터 제어 정책의 엔드 투 엔드 훈련을 가능하게 하는가?

주요 결과

  • OptLayer는 제约束 없는 정책 학습 대비 평균 수익 700에 도달하는 데 필요한 에피소드 수를 38% 감소시켰다 (3250 에피소드 대비 5350 에피소드).
  • 실제 산업용 조작자에서 정적 및 동적 장애물 회피를 포함한 3D 도달 작업을 성공적으로 수행하였으며, 6시간에 걸친 연속 훈련 동안 안전성을 유지하였다.
  • CPC(Constrained Policy Correction)로 학습된 제약 정책는 재학습 없이도 이동하는 목표물 및 장애물과 같은 새로운 시나리오로 일반화되었다.
  • 스텝당 4ms의 추론 오버헤드가 존재함에도 불구하고, 더 효율적인 탐색과 낮은 실패율 덕분에 전체 학습 속도가 빨라졌다.
  • 정적 및 동적 장애물, 예를 들어 풍선과 케이크와 같은 물체를 포함하여 충돌을 성공적으로 피함으로써 환경 변화에 대한 강건성을 입증하였다.
  • OptLayer는 물리적 상호작용이나 힘 제어가 필요한 작업조차도 실세계에서 안전하고 자율적인 위치 제어 정책 학습을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.