Skip to main content
QUICK REVIEW

[논문 리뷰] Catch & Carry: Reusable Neural Controllers for Vision-Guided Whole-Body Tasks

Josh Merel, Saran Tunyasuvunakool|arXiv (Cornell University)|2019. 11. 15.
Human Pose and Action Recognition참고 문헌 83인용 수 15
한 줄 요약

이 논문은 시각 유도 전신 인간형 로봇 작업을 위한 재사용 가능한 신경 컨트롤러 프레임워크를 제안한다. 고급 강화 학습 기반의 계층적 접근을 통해 운동 캡처 데이터에서 유도된 운동 프리미티브를 활용한다. 시각 중심 관점, 메모리 증강 태스크 정책, 커리큘럼 학습을 조합함으로써, 시뮬레이션에서 복구 및 일반화 능력이 뛰어난 제어 성능을 달성한다. 구체적으로 볼 던지기 및 상자 들기 등의 작업에서 실시간 추론이 표준 하드웨어에서 가능하다.

ABSTRACT

We address the longstanding challenge of producing flexible, realistic humanoid character controllers that can perform diverse whole-body tasks involving object interactions. This challenge is central to a variety of fields, from graphics and animation to robotics and motor neuroscience. Our physics-based environment uses realistic actuation and first-person perception -- including touch sensors and egocentric vision -- with a view to producing active-sensing behaviors (e.g. gaze direction), transferability to real robots, and comparisons to the biology. We develop an integrated neural-network based approach consisting of a motor primitive module, human demonstrations, and an instructed reinforcement learning regime with curricula and task variations. We demonstrate the utility of our approach for several tasks, including goal-conditioned box carrying and ball catching, and we characterize its behavioral robustness. The resulting controllers can be deployed in real-time on a standard PC. See overview video, https://youtu.be/2rQAW-8gQQk .

연구 동기 및 목표

  • 물체 상호작용을 포함한 다양한 전신 작업을 수행할 수 있는 유연하고 재사용 가능한 컨트롤러를 개발하기.
  • 현실적인 인지 및 구동 조건을 갖춘 물리 기반 시뮬레이션에서 시각 기반, 목표 조건 기반 행동을 가능하게 하기.
  • 작업 특화 성능와 운동 일반성 사이의 균형을 유지하여 새로운 물체와 구성으로의 전이를 가능하게 하기.
  • 밀도 높은 보상 형식에 의존하는 것을 줄이고, 커리큘럼 학습과 운동 캡처 시연을 활용하기.
  • 표준 하드웨어에서 실시간 배포가 가능한 모터 재사용을 지원하는 확장 가능한 아키텍처 구축하기.

제안 방법

  • 하나의 저수준 운동 프리미티브 모듈은 인간의 운동 캡처 데이터를 학습하여, 장면에 관계없이 재사용 가능한 운동을 가능하게 한다.
  • 고수준 태스크 정책은 시각 중심 관측치와 메모리를 사용하여 운동 모듈의 목표 조건 기반 명령을 생성한다.
  • 지시된 강화 학습 체제에 커리큘럼 학습과 작업 변형을 통합하여 샘플 효율성과 행동의 강건성을 향상시킨다.
  • 프레임워크는 희박한 보상과 커리큘럼 기반 탐색을 통합하며, 운동 캡처 데이터를 활용해 유리한 상태를 초기화한다.
  • 얕은 MLP 기반의 인코더-디코더 아키텍처는 태스크 정책 출력을 운동 명령으로 매핑하여 효율적인 실시간 추론을 가능하게 한다.
  • 시스템은 현실적인 센서(터치 및 1인칭 시각 포함)를 갖춘 물리 기반 시뮬레이션 환경에서 훈련된다.

실험 결과

연구 질문

  • RQ1희박한 보상과 시각 정보만을 사용하여 다양한 전신 작업을 수행할 수 있는 재사용 가능한 신경 컨트롤러를 훈련시킬 수 있는가?
  • RQ2인간의 운동 캡처 데이터를 통합함으로써, 시각 기반 제어에서 샘플 효율성과 행동의 현실감이 어떻게 향상되는가?
  • RQ3커리큘럼 학습을 통한 계층적 강화 학습 접근이 새로운 물체 구성과 작업으로의 일반화에 얼마나 효과적인가?
  • RQ4메모리와 시각 중심 인지가 복잡한 조작 작업에서 강건하고 목표 지향적인 행동을 가능하게 하는 데 어떤 역할을 하는가?
  • RQ5제안된 프레임워크는 표준 하드웨어에서 높은 작업 성공률을 유지하면서도 실시간 성능를 달성할 수 있는가?

주요 결과

  • 희박한 보상과 시각 전용 입력 조건에서 시뮬레이션에서 볼 던지기 작업의 성공률이 95%에 도달하고, 상자 들기 작업의 성공률이 90%에 이르며 높은 성능를 기록한다.
  • 훈련 중에 볼 수 없었던 새로운 물체 위치와 구성에도 컨트롤러가 일반화되어 있으며, 강건성과 전이 가능성의 증거를 보인다.
  • 운동 캡처 기반 초기화가 창고 내 이동과 같은 복잡한 작업에서 학습 속도를 크게 향상시키며 샘플 복잡도를 감소시킨다.
  • 시스템은 표준 PC에서 실시간으로 작동하며, 단계당 추론 지연이 10ms 미만으로 유지되어 상호작용 가능한 배포가 가능하다.
  • 행동 분석 결과, 학습 과정에서 자동으로 시각 추적 및 전신 운동의 조율과 같은 활성 감지 패턴이 자연스럽게 나타난다.
  • 특히 커리큘럼 학습과 작업 변형을 활용할 경우, 샘플 효율성과 일반화 능력에서 기준 방법보다 뛰어난 성능를 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.