Skip to main content
QUICK REVIEW

[논문 리뷰] DRL: Deep Reinforcement Learning for Intelligent Robot Control -- Concept, Literature, and Future

Aras R. Dargazany|arXiv (Cornell University)|2021. 04. 20.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 시각 기반 관측, 기록된 전문가 지시(보상과 행동 포함), 그리고 컨volution 신경망을 갖춘 딥 Q네트워크(DQN)를 사용하여 종합적으로 최적의 제어 정책을 학습하는 일반 목적의, 응용 및 플랫폼에 관계없는 딥 강화학습(DRL) 프레임워크를 제안한다. 주요 기여는 다양한 로봇 플랫폼과 작업에 걸쳐 자율적이고 견고하며 일반화 가능한 로봇 학습을 가능하게 하는 고수준의 분리된 제어 아키텍처이다.

ABSTRACT

Combination of machine learning (for generating machine intelligence), computer vision (for better environment perception), and robotic systems (for controlled environment interaction) motivates this work toward proposing a vision-based learning framework for intelligent robot control as the ultimate goal (vision-based learning robot). This work specifically introduces deep reinforcement learning as the the learning framework, a General-purpose framework for AI (AGI) meaning application-independent and platform-independent. In terms of robot control, this framework is proposing specifically a high-level control architecture independent of the low-level control, meaning these two required level of control can be developed separately from each other. In this aspect, the high-level control creates the required intelligence for the control of the platform using the recorded low-level controlling data from that same platform generated by a trainer. The recorded low-level controlling data is simply indicating the successful and failed experiences or sequences of experiments conducted by a trainer using the same robotic platform. The sequences of the recorded data are composed of observation data (input sensor), generated reward (feedback value) and action data (output controller). For experimental platform and experiments, vision sensors are used for perception of the environment, different kinematic controllers create the required motion commands based on the platform application, deep learning approaches generate the required intelligence, and finally reinforcement learning techniques incrementally improve the generated intelligence until the mission is accomplished by the robot.

연구 동기 및 목표

  • 특정 플랫폼, 응용 프로그램 또는 저수준 제어기와 독립적인 일반 목적의 고수준 제어 아키텍처가 부족한 문제를 해결하기 위해.
  • 고수준 지능형 학습과 저수준 운동 제어를 분리함으로써 로봇 제어 연구를 통합하고, 개별 개발을 가능하게 하기 위해.
  • 딥 강화학습과 이민 학습을 기반으로 한 일반 목적의 AI 프레임워크를 표준화하여 로봇 분야의 빠른 발전을 촉진하기 위해.
  • 수동으로 설정된 규칙의 필요성을 최소화하고, RGB-D 카메라 입력과 기록된 전문가 트레이젝터리만을 사용하여 뷰어에서 액션으로의 종단 간 학습을 가능하게 하기 위해.
  • 자기 보상 생성, 자기 지도 학습, 이민 학습을 통한 소수의 샘플에 기반한 적응을 통해 향후 AGI 수준의 로봇 자율성의 기반을 마련하기 위해.

제안 방법

  • 프레임워크는 동일한 로봇 플랫폼을 사용하는 인간 트레이너가 운영한 저수준 제어 데이터(관측, 행동, 보상)를 전문가 지시로 사용한다.
  • 딥 Q네트워크(DQN)와 컨volution 신경망(CNN)을 사용하여 원시 RGB-D 이미지를 입력으로 받아 Q-값 함수를 학습한다.
  • DQN 에이전트는 전문가 지시 데이터 세트 내에서 성공 및 실패 경험을 모두 학습함으로써 누적 보상을 최대화하는 행동을 선택하는 방식으로 학습한다.
  • 고수준 제어 정책은 저수준 운동 제어기와 독립적으로 학습되므로, 다양한 로봇 시스템 간에 모듈러한 개발과 재사용이 가능하다.
  • 시각 입력에서 토크 명령까지의 종단 간 학습을 지원하며, 시간적 순서 모델링을 위해 순환 신경망(LSTM)과 같은 확장도 가능하다.
  • 프레임워크는 응용 및 플랫폼에 관계없도록 설계되어, 탁구를 위한 테이블 테니스 작업을 수행하는 KUKA KR6 R 900 Sixx Agilus를 포함한 다양한 로봇에 배포 가능하다.

실험 결과

연구 질문

  • RQ1시각과 전문가 지시 데이터만을 사용하여 일반 목적의, 응용 및 플랫폼에 관계없는 딥 강화학습 프레임워크를 설계할 수 있는가?
  • RQ2고수준 의사결정 지능을 저수준 운동 제어에서 분리하여 모듈러하고 재사용 가능하며 확장 가능한 로봇 학습 시스템을 어떻게 설계할 수 있는가?
  • RQ3DQN과 CNN을 사용한 딥 강화학습는 얼마나 적은 인간 간섭으로 복잡한 조작 작업에서 견고하고 종단 간 뷰어에서 액션으로의 정책 학습을 가능하게 하는가?
  • RQ4다중 모odal 센서 융합(예: RGB-D, LIDAR, 고속 카메라)은 동적인 환경에서 견고하고 실시간 로봇 제어를 위해 어떤 역할을 하는가?
  • RQ5성공과 실패의 경험 재생을 통해 자기 보상 생성과 자기 지도 학습을 달성할 수 있으며, 이는 자율적이고 인간 수준의 로봇 지능을 가능하게 하는가?

주요 결과

  • 제안된 DRL 프레임워크는 특정 로봇 플랫폼, 응용 프로그램 및 저수준 제어기와 독립적인 고수준 로봇 제어를 가능하게 하여 재사용성과 모듈성을 향상시킨다.
  • RGB-D 이미지에 대한 DQN과 CNN을 사용한 종단 간 학습은 뷰어와 전문가 지시 데이터로부터 복잡한 조작 작업을 직접 학습할 수 있도록 한다.
  • 성공 및 실패 경험 모두로부터의 학습을 지원함으로써, 명시적 보상 형상화 없이도 강화학습을 통한 점진적 향상이 가능하다.
  • 기록된 전문가 지시(관측, 행동, 보상 포함)의 사용은 효과적인 이민 학습과 행동 클로닝을 가능하게 하여 광범위한 환경 상호작용의 필요성을 줄인다.
  • KUKA KR6 R 900 Sixx Agilus와 같은 복잡한 로봇 시스템에도 확장 가능하며, 이는 고속 카메라, LIDAR, 테니스 볼 던지기 장치를 갖추고 있어 테이블 테니스 학습에 적합하다.
  • 이 연구는 DRL이 진정으로 AGI 수준의 로봇 자율성을 달성하기 위한 가장 타당한 길임을 규명하며, 특히 자기 보상 생성, 자기 지도 학습, 전문가 지시로부터의 소수의 샘플 학습과 조합될 경우 더욱 그렇다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.