Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Compose Hierarchical Object-Centric Controllers for Robotic Manipulation

Mohit Sharma, Jacky Liang|arXiv (Cornell University)|2020. 11. 09.
Robot Manipulation and Learning인용 수 8
한 줄 요약

이 논문은 강화학습(RL) 기반 방법을 제안하여 로봇 조작 작업을 위한 동적이고 계층적인 객체 중심 제어기를 구성한다. 환경 내 객체에 기반한 순서화된 작업축 제어기들을 학습함으로써, 각 제어기는 노울스페이스 프로젝션을 통해 조합되며, 이로 인해 더 높은 샘플 효율성, 미사전 학습 환경에 대한 제로샷 일반화, 그리고 보정 없이도 네 가지 시뮬레이션 및 실제 작업에서의 시뮬레이션에서 실제 환경으로의 전이 성능 향상이 달성된다.

ABSTRACT

Manipulation tasks can often be decomposed into multiple subtasks performed in parallel, e.g., sliding an object to a goal pose while maintaining contact with a table. Individual subtasks can be achieved by task-axis controllers defined relative to the objects being manipulated, and a set of object-centric controllers can be combined in an hierarchy. In prior works, such combinations are defined manually or learned from demonstrations. By contrast, we propose using reinforcement learning to dynamically compose hierarchical object-centric controllers for manipulation tasks. Experiments in both simulation and real world show how the proposed approach leads to improved sample efficiency, zero-shot generalization to novel test environments, and simulation-to-reality transfer without fine-tuning.

연구 동기 및 목표

  • 모듈러하고 객체 중심적인 제어기를 사용하여 로봇 조작 작업에서 다수의 병렬 하위 작업을 조합하는 문제에 대응하기 위해.
  • 수동 설계나 인간의 시연에 의존하지 않고, 동적으로 학습된 제어기 계층의 선택을 가능하게 하기 위해.
  • 구조화된 계층적 제어기 조합을 통해 복잡한 조작 작업에서 샘플 효율성과 일반화 능력을 향상시키기 위해.
  • 도메인 랜덤라이제이션 또는 보정 없이도 견고한 시뮬레이션에서 실제 환경으로의 전이를 달성하기 위해.
  • 객체 기반 제어를 통해 인덕티브 바이어스를 도입하여 크기와 같은 객체 성질에 대한 정책의 불변성을 향상시키기 위해.

제안 방법

  • 이 방법은 강화학습 정책을 사용하여 특정 객체 또는 기하학적 특성(예: 표면 법선, 객체 방향)에 기반한 저수준의 객체축 제어기의 순서화된 목록을 선택한다.
  • 제어기는 노울스페이스 프로젝션을 통해 조합되며, 우선순위가 낮은 제어기는 우선순위가 높은 제어기의 노울스페이스에 투영되어 간섭을 방지한다.
  • 행동 공간은 제어기의 계층으로 구성되어 있어, 위치 조절 및 힘 적용과 같은 병행 실행 가능한 하위 작업을 가능하게 한다.
  • 더 긴 제어기 실행 주기(T 단위)를 허용하기 위해 확장된 MDP 설정을 사용하여 샘플 효율성을 향상시킨다.
  • 정책은 시뮬레이션에서 학습되고, 블록 맞추기, 밀기, 나사 조임, 문 열기 등의 시뮬레이션 및 실제 작업에서 평가된다.
  • 이 방법은 추가 보정 없이도 새로운 환경 구성에 대한 제로샷 일반화와 시뮬레이션에서 실제 환경으로의 전이를 가능하게 한다.

실험 결과

연구 질문

  • RQ1RL 정책이 복잡한 조작 작업을 해결하기 위해 다수의 객체 중심 제어기를 동적으로 조합하는 것을 학습할 수 있는가?
  • RQ2노울스페이스 프로젝션을 통한 계층적 조합이 동시에 실행되는 하위 작업 간의 간섭을 방지하는가?
  • RQ3학습된 제어기 선택 정책이 보정 없이도 새로운 환경 구성에 일반화되는가?
  • RQ4고정 또는 단일 제어기 정책과 비교해 본다면, 이 방법이 더 높은 샘플 효율성을 달성하는가?
  • RQ5이 방법이 도메인 랜덤라이제이션 또는 보정 없이도 시뮬레이션에서 실제 세계로의 전이를 달성하는가?

주요 결과

  • 제안된 방법은 시뮬레이션에서 블록 맞추기 작업에서 성공률 0.99 (±0.01)을 달성했으며, 30K단계의 학습 곡선을 기록하여 기준 모델의 T=10일 때 요구하는 10M단계보다 훨씬 빠르게 성능을 달성했다.
  • 이 방법은 새로운 테스트 환경 구성에 대한 제로샷 일반화를 보였으며, 프랭카 문 열기 작업에서 시뮬레이션에서는 성공률 1.00, 실제 환경 테스트에서는 0.99 (±0.01)의 성과를 기록했다.
  • 제어기 선택 정책은 다양한 객체 간의 제어기를 조합하는 것을 학습했으며, 예를 들어 벽을 주요 위치 조절용으로, 다른 벽을 보조 정렬용으로 선택하는 방식을 구현했다.
  • 제어기가 객체 기반으로 설계되어 있어, 크기와 같은 객체 성질의 변동성에 대해 정책이 강건함을 보였다.
  • 실제 로봇 작업(나사 조임 및 문 열기)에 대해 보정 없이도 시뮬레이션에서 실제 환경으로의 전이를 달성했으며, 각각 성공률 0.99 (±0.01)과 0.93 (±0.03)을 기록했다.
  • 절단 실험 결과, 제어기 실행 주기(T=80)를 늘리면 샘플 효율성이 향상되었고, 단일 제어기 정책은 높은 T에서 성능이 열악하게 나타나, 병렬 제어기 조합의 중요성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.