Skip to main content
QUICK REVIEW

[논문 리뷰] Generalization in Dexterous Manipulation via Geometry-Aware Multi-Task Learning

Wenlong Huang, Igor Mordatch|arXiv (Cornell University)|2021. 11. 04.
Reinforcement Learning in Robotics참고 문헌 41인용 수 24
한 줄 요약

이 논문은 단일 기하학 인식 다중 작업 정책이 100개가 넘는 다양한 실세계 물체에서의 손 안 조작을 수행하고 보이지 않는 기하학에 일반화하며, 종종 단일 물체 전문가를 능가한다는 것을 보여준다. 포인트 클라우드 기반 물체 표현과 일반화 제로샷을 달성하기 위한 다중 작업 학습을 도입한다.

ABSTRACT

Dexterous manipulation of arbitrary objects, a fundamental daily task for humans, has been a grand challenge for autonomous robotic systems. Although data-driven approaches using reinforcement learning can develop specialist policies that discover behaviors to control a single object, they often exhibit poor generalization to unseen ones. In this work, we show that policies learned by existing reinforcement learning algorithms can in fact be generalist when combined with multi-task learning and a well-chosen object representation. We show that a single generalist policy can perform in-hand manipulation of over 100 geometrically-diverse real-world objects and generalize to new objects with unseen shape or size. Interestingly, we find that multi-task learning with object point cloud representations not only generalizes better but even outperforms the single-object specialist policies on both training as well as held-out test objects. Video results at https://huangwl18.github.io/geometry-dex

연구 동기 및 목표

  • 다양한 물체에 걸쳐 일반화되는 손 안의 정교한 조작을 촉진한다.
  • 다중 작업 학습이 훈련된 물체에서 단일 작업 전문가와 대등하거나 더 우수하다는 것을 보인다.
  • 보이지 않는 물체에 대한 일반화를 개선하기 위해 기하학 인식 물체 표현을 도입한다.
  • 표현(A representation)을 강화한 다중 작업 학습이 더 많은 훈련 물체에서 확장될 수 있음을 보여준다.

제안 방법

  • 객체들 간의 그래디언트를 합산하여 다중 작업 설정에서 Hindsight Experience Replay를 사용하는 DDPG를 확장한다.
  • 현재 방향과 목표 방향의 두 포인트 클라우드 입력을 기반으로 물체 클래스와 상대 회전을 예측하는 기하학 인식 물체 표현 인코더를 도입한다.
  • 물체 포인트 클라우드에서 인코더를 사전 학습시키고, 강화 학습(RL) 훈련 중에 이를 고정하여 행위자(actor)와 비평가(critic)의 조건부에 인코더 표현을 포함시킨다.
  • 다수의 물체에 걸쳐 단일 정책을 학습시키고 이를 각 물체별 오라클 정책과 비교한다.
  • 기하학적으로 다양한 물체의 보류 세트(총 114개 물체; 85개 학습, 29개 테스트)에 대한 제로샷 일반화를 평가한다.
  • 시뮬레이션된 OpenAI Gym 기반 벤치마크(Shadow Hand)를 제공하고 향후 연구를 위한 데이터셋을 공개한다.

실험 결과

연구 질문

  • RQ1바닐라 다중 작업 정책이 다수의 물체에 걸쳐 per-object 전문가에 비해 경쟁력 있는 성능을 달성할 수 있는가?
  • RQ2기하학 인식 물체 표현을 추가하는 것이 보이지 않는 물체에 대한 제로샷 일반화를 개선하는가?
  • RQ3훈련 물체의 수가 보류 대상 물체에 대한 일반화에 어떤 영향을 미치는가?
  • RQ4사전 학습된 물체 인코더를 고정하는 것이 정책 학습 중 파인튜닝하는 것보다 유익한가?

주요 결과

  • 85개 물체에서 학습된 단일 다중 작업 정책은 각 물체 오라클 정책의 평균 성능에 비례하거나 이를 따라가며 샘플 효율성은 17배 더 좋다(샘플 수 200M 대 3400M).
  • 기하학 인식 물체 표현을 사용하면 다중 작업 정책이 보류 물체에서 제로샷 평가에서 per-object 오라클을 능가할 수 있다.
  • 물체 표현의 이점은 단일 작업 정책에서도 지속되어 보류 및 학습 물체 성능을 향상시킨다.
  • 훈련 물체 수를 늘리면 제로샷 일반화가 향상되며, 표현 기반 방법이 더 강한 스케일링을 보인다.
  • 인코더를 고정하는 것이 정책 학습 중 파인튜닝하는 것보다 더 나은 성능을 낳고, 많은 물체에 대해 사전 학습하는 것이 보류 물체에 대한 단일 작업 성능을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.