[논문 리뷰] Imitating Task and Motion Planning with Visuomotor Transformers
이 논문은 작업 및 운동 계획(TAMP) 에이전트의 행동을 모방하기 위해 애니메이션 학습을 통해 훈련된 시각운동 트랜스포머 정책인 OPTIMUS를 제안한다. 이는 빠르고 반응성이 뛰어나며 일반화 능력이 뛰어난 로봇 조작을 가능하게 한다. TAMP에 의해 자동으로 생성된 대규모이고 다양한 시나리오의 시연 데이터를 활용함으로써, OPTIMUS는 최대 8단계와 72종의 다양한 물체를 포함한 300개 이상의 장기 수평 작업에서 70–80%의 성공률을 달성하며, 특권 상태 정보 없이도 뛰어난 일반화 능력과 종단 간 제어 성능을 보여준다.
Imitation learning is a powerful tool for training robot manipulation policies, allowing them to learn from expert demonstrations without manual programming or trial-and-error. However, common methods of data collection, such as human supervision, scale poorly, as they are time-consuming and labor-intensive. In contrast, Task and Motion Planning (TAMP) can autonomously generate large-scale datasets of diverse demonstrations. In this work, we show that the combination of large-scale datasets generated by TAMP supervisors and flexible Transformer models to fit them is a powerful paradigm for robot manipulation. To that end, we present a novel imitation learning system called OPTIMUS that trains large-scale visuomotor Transformer policies by imitating a TAMP agent. OPTIMUS introduces a pipeline for generating TAMP data that is specifically curated for imitation learning and can be used to train performant transformer-based policies. In this paper, we present a thorough study of the design decisions required to imitate TAMP and demonstrate that OPTIMUS can solve a wide variety of challenging vision-based manipulation tasks with over 70 different objects, ranging from long-horizon pick-and-place tasks, to shelf and articulated object manipulation, achieving 70 to 80% success rates. Video results and code at https://mihdalal.github.io/optimus/
연구 동기 및 목표
- 애니메이션 학습에서 인간 레이블러가 생성한 로봇 시연 데이터 수집의 확장성과 노동 집약적인 문제를 해결하기 위해.
- 자율적인 TAMP에 의해 생성된 데이터셋을 활용하여 효율적이고 반응성 있으며 일반화 능력이 뛰어난 시각운동 정책을 가능하게 하기 위해.
- 특권 정보와 다중 모달 시연과 같은 TAMP 모방 과제에 직면한 도전 과제를 트랜스포머 기반 아키텍처를 통해 효과적으로 해결하고자 하기 위해.
- 명시적인 작업 수준 액션 기반 정보 없이도 고주기(30–50Hz)로 작동하는 확장 가능한 종단 간 시각운동 정책을 개발하기 위해.
- TAMP의 시연 데이터를 기반으로 한 모방 학습이 다양한 물체 형상과 작업 인스턴스 간 일반화 능력을 향상시키며, TAMP의 반응성과 실시간 실행 능력의 한계를 초월하는 정책을 도출할 수 있는지 검증하기 위해.
제안 방법
- TAMP 감독자에 의해 생성된 성공적인 궤적의 다양한 대규모 데이터셋을 기반으로 오프라인 행동 클로닝을 사용하여 대규모 시각운동 트랜스포머 정책을 훈련한다.
- 시스템은 원시 관측값(예: RGB 이미지)을 처리하고 30–50Hz에서 저수준 제어 명령어를 출력함으로써 실시간 반응형 제어를 가능하게 한다.
- 명시적인 작업 수준 액션 예측 없이도 작업 구조에 암묵적으로 추론할 수 있도록 설계되어, 다양한 수의 물체와 작업 단계에 걸쳐 일반화할 수 있다.
- TAMP가 기하학적 및 의미적 특권 정보를 활용하여 고품질 궤적을 생성할 수 있도록, 작업 관련이고 다양한 시나리오의 시연 데이터를 생성하는 데이터 생성 파이프라인을 개발하였다.
- 다중 모달 시연을 다루고 전문가 정책과 모의 정책 간 분포 이탈을 줄이기 위해 아키텍처 및 훈련 통찰을 통합하였다.
- 장기 수평 조작 작업의 넓은 분포에서 평가되었으며, 이는 픽업 앤 플레이스, 선반에 놓기, 구조물이 있는 물체 조작 등이 포함된다.

실험 결과
연구 질문
- RQ1TAMP에 의해 생성된 시연 데이터를 기반으로 한 애니메이션 학습을 통해 훈련된 시각운동 트랜스포머 정책이 특권 상태 정보 없이 다양한 장기 수평 조작 작업에 대해 일반화할 수 있는가?
- RQ2특권 정보 의존성과 다중 모달 시연과 같은 TAMP 모방 과제를 효과적으로 해결하기 위해 스케일러블한 애니메이션 학습 프레임워크를 어떻게 설계할 수 있는가?
- RQ3학습된 정책이 TAMP 감독자로부터의 시연 데이터를 기반으로 하되, 반응성과 내구성 측면에서 TAMP 감독자를 초월할 수 있는가?
- RQ4성공적인 TAMP 모방을 위한 데이터 생성, 네트워크 아키텍처, 훈련 전략에서 필수적인 설계 선택은 무엇인가?
- RQ5결과 정책이 다양한 물체 형상과 작업 인스턴스에 걸쳐 일반화 능력을 유지하면서도 고주기 종단 간 제어를 달성할 수 있는가?
주요 결과
- OPTIMUS는 최대 8단계와 72종의 다양한 물체를 포함한 300개 이상의 장기 수평 조작 작업에서 70–80%의 성공률을 달성하며 강력한 일반화 능력을 보여주었다.
- 학습 중에 볼 수 없었던 새로운 물체 형상과 작업 구성에 대해서도 효과적으로 일반화되었으며, 이는 강력한 시각적 추론과 적응 능력을 시사한다.
- 30–50Hz에서 작동하여 명시적인 작업 수준 액션 예측이나 특권 상태 추정 없이도 실시간 반응형 제어를 가능하게 한다.
- 복잡한 다중 모달 TAMP 궤적, 즉 다양한 물체에 대한 다중 그립과 순차적 상호작용을 포함한 궤적을 성공적으로 모방한 시각운동 트랜스포머 정책이었다.
- 다이나믹하거나 부분 관측 환경에서 반응성과 내구성 측면에서 TAMP 감독자보다 성능이 뛰어난 정책을 도출하였다.
- 대규모이고 다양한 데이터셋을 TAMP가 자동 생성함으로써 애니메이션 학습을 통한 일반화 능력이 뛰어나고 고주기 시각운동 정책을 훈련하는 데 매우 효과적임을 검증하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.