[논문 리뷰] Zero-Shot Robot Manipulation from Passive Human Videos
이 논문은 인터넷에서의 수동적 인간 영상만을 사용하여 제로샷 로봇 조작 프레임워크를 제안한다. 모델은 단일 장면 이미지에서 인간 손의 타당한 궤적을 예측하고, 미세조정 없이 이를 로봇 동작으로 매핑한다. 훈련에 웹 스케일의 이석적 영상만을 사용하여, 조건이 없는 작업에서는 약 40–60%의 성공률, 목표 조건이 있는 작업에서는 약 30–40%의 성공률을 달성한다.
Can we learn robot manipulation for everyday tasks, only by watching videos of humans doing arbitrary tasks in different unstructured settings? Unlike widely adopted strategies of learning task-specific behaviors or direct imitation of a human video, we develop a a framework for extracting agent-agnostic action representations from human videos, and then map it to the agent's embodiment during deployment. Our framework is based on predicting plausible human hand trajectories given an initial image of a scene. After training this prediction model on a diverse set of human videos from the internet, we deploy the trained model zero-shot for physical robot manipulation tasks, after appropriate transformations to the robot's embodiment. This simple strategy lets us solve coarse manipulation tasks like opening and closing drawers, pushing, and tool use, without access to any in-domain robot manipulation trajectories. Our real-world deployment results establish a strong baseline for action prediction information that can be acquired from diverse arbitrary videos of human activities, and be useful for zero-shot robotic manipulation in unseen scenes.
연구 동기 및 목표
- 인터넷에서의 비정형적, 수동적 인간 영상만을 사용하여 제로샷 로봇 조작을 가능하게 하기 위해.
- 다양한 인간-물체 상호작용 영상에서 에이전트에 종속되지 않는 행동 표현을 학습하기 위해.
- 도메인 내 시연나 미세조정 없이도, 새로운 환경에서 실제 로봇에 이러한 표현을 전이하기 위해.
- 웹 영상에서의 행동 예측이 실제 환경에서 신뢰할 수 있는 조작을 가능하게 하는지 평가하기 위해.
제안 방법
- 단일 장면 이미지에서 2초 동안의 6차원 손 궤적(손바닥 중심 자세)을 예측하는 확률적 모델을 훈련한다.
- Epic-Kitchens와 같은 데이터셋에서 얻은 다양한 이석적 영상을 사용해 궤적 예측 모델을 훈련한다.
- 운동학적 매핑을 통해 인간 손 궤적을 로봇 종단기구 궤적으로 변환한다.
- 역운동학 제어기를 통해 예측된 궤적을 실행함으로써 모델을 제로샷으로 실제 환경에 구현한다.
- 두 가지 변종을 개발한다: 조건이 없는(타당한 행동을 예측) 및 목표 조건이 있는(지정된 목표 상태에 도달하기 위한 행동을 예측).
- 목표 모델을 목적 상태의 장면이 보이는 목표 이미지로 조건화한다.
실험 결과
연구 질문
- RQ1수동적 인간 영상에서 추출한 행동 표현이 새로운 환경에서 제로샷 로봇 조작으로 일반화될 수 있는가?
- RQ2다양한 인터넷 영상에서 훈련된 단일 통합 모델이 실제 로봇에 대한 제로샷 배포에 얼마나 효과적인가?
- RQ3목표 조건화가 조건이 없는 행동 예측에 비해 제로샷 로봇 조작의 신뢰성과 작업 특이성에 얼마나 기여하는가?
- RQ4인간 영상에서의 로봇 제어로의 궤적 전이에 있어 주요 실패 유형은 무엇인가?
- RQ5비전문가, 비정형적 인간 영상에서 훈련된 모델이 실험실 데이터 없이도 실제 조작 작업에서 의미 있는 성공률을 달성할 수 있는가?
주요 결과
- 조건이 없는 모델은 서랍 열기/닫기, 밀기, Bowls 옮기기와 같은 거시적 조작 작업에서 40–60%의 성공률를 기록했다.
- 목표 조건이 있는 모델은 문을 완전히 열거나 야채를 목표 위치로 옮기는 것과 같은 특정 목표 상태에 도달하는 데 30–40%의 성공률를 기록했다.
- 목표 조건이 있는 모델은 특정 구성에 도달하는 데서 조건이 없는 모델보다 우수했으며, 10회의 시험 중 4회가 목표 서랍 상태에 도달한 데 비해, 조건이 없는 모델는 3회였다.
- 실패 분석 결과, 조건이 없는 모델의 40%의 실패는 잘못된 초기 접촉에서 기인했고, 60%는 비가능한 운동(예: 문을 바깥쪽으로 당기기)에서 기인했다.
- 목표 조건이 있는 모델의 세 번째 실패 유형(실패의 40%)은 로봇이 타당한 행동을 수행했지만, 목표가 지정한 행동이 아니었을 경우였다(예: 잘못된 서랍 열기).
- 3D Scene Flow와 같은 베이스라인 모델보다 성능이 뛰어나, 더 적은 데이터로 11%의 성공률, 전체 데이터로 평균 37%의 성공률를 기록하여 대규모이고 다양한 웹 영상의 가치를 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.