Skip to main content
QUICK REVIEW

[논문 리뷰] Robot Learning and Execution of Collaborative Manipulation Plans from YouTube Videos.

Hejia Zhang, Stefanos Nikolaidis|arXiv (Cornell University)|2019. 11. 25.
Multimodal Machine Learning Applications참고 문헌 44인용 수 8
한 줄 요약

이 논문은 언어적이고 계층적인 동작 표현을 활용하여 비정형적인 유튜브 요리 영상에서 로봇이 협동적 운반 작업 계획을 학습하고 실행할 수 있는 프레임워크를 제안한다. 객체 레이블이 부여된 영상을 처리하여 실행 가능한 로봇 계획을 생성하며, 표준화된 100개의 영상과 세 편의 전장 영상에서 성공을 입증했고, 오픈소스 시뮬레이션 및 실제 로봇 배포 지원 기능을 제공한다.

ABSTRACT

People often watch videos on the web to learn how to cook new recipes, assemble furniture or repair a computer. We wish to enable robots with the very same capability. This is challenging; there is a large variation in manipulation actions and some videos even involve multiple persons, who collaborate by sharing and exchanging objects and tools. Furthermore, the learned representations need to be general enough to be transferable to robotic systems. On the other hand, previous work has shown that the space of human manipulation actions has a linguistic, hierarchical structure that relates actions to manipulated objects and tools. Building upon this theory of language for action, we propose a framework for understanding and executing demonstrated action sequences from full-length, unconstrained cooking videos on the web. The framework takes as input a cooking video annotated with object labels and bounding boxes, and outputs a collaborative manipulation action plan for one or more robotic arms. We demonstrate performance of the system in a standardized dataset of 100 YouTube cooking videos, as well as in three full-length Youtube videos that include collaborative actions between two participants. We additionally propose an open-source platform for executing the learned plans in a simulation environment as well as with an actual robotic arm.

연구 동기 및 목표

  • 로봇이 인간이 온라인 튜토리얼을 통해 배우는 방식과 유사하게, 비정형적이고 전장 영상인 유튜브 영상에서 복잡한 운반 작업을 학습할 수 있도록 한다.
  • 웹 영상에서의 인간 행동의 변동성, 다인 참여 협업, 물체/도구 공유 문제를 해결한다.
  • 로봇 실행에 매핑될 수 있는 일반화 가능하고 이식 가능한 운반 동작 표현 방식을 개발한다.
  • 객체 수준의 레이블이 부여된 영상 입력에서 실행 가능한 다로봇 운반 계획을 생성할 수 있는 시스템을 구축한다.
  • 시뮬레이션 및 실제 로봇 암에 학습된 계획을 배포하기 위한 오픈소스 플랫폼을 제공한다.

제안 방법

  • 영상 시퀀스 내 동작, 물체, 도구 간의 관계를 모델링하기 위해 언어적이고 계층적인 동작 표현 방식을 활용한다.
  • 객체 레이블과 바운딩 박스가 부여된 입력 영상을 처리하여 시공간적 동작 세그먼트를 추출한다.
  • 관찰된 동작을 물체 운반 관계에 기반한 의미적 동작 공간에 매핑함으로써 구조화된 동작 계획을 추론한다.
  • 추론된 동작 시퀀스와 물체 의존성에 기반해 하나 이상의 로봇 암을 위한 협동적 운반 계획을 구성한다.
  • 영상 이해, 동작 세그멘테이션, 계획 생성을 통합하는 모듈러한 파이프라인을 활용해 로봇 실행을 위한 계획을 생성한다.
  • 학습된 계획을 실행하고 검증하기 위한 오픈소스 시뮬레이션 및 실제 로봇 인터페이스를 제공한다.

실험 결과

연구 질문

  • RQ1로봇은 최소한의 감독 하에 비제한적이고 전장 영상인 유튜브 요리 영상에서 협동적 운반 계획을 학습할 수 있는가?
  • RQ2언어적이고 계층적인 동작 표현 방식은 다양한 운반 동작과 다인 협업 상황에 얼마나 잘 일반화되는가?
  • RQ3학습된 계획이 실제 로봇 시스템으로의 실행에 얼마나 잘 이식 가능한가?
  • RQ4이 프레임워크는 웹 영상에서의 동작 실행 변동성, 물체 상호작용, 도구 사용에 대해 얼마나 효과적으로 대응하는가?
  • RQ5객체 수준의 레이블이 부여된 원시 영상 입력에서 실행 가능한 다로봇 운반 계획을 생성할 수 있는가?

주요 결과

  • 프레임워크는 표준화된 데이터셋에 포함된 100개의 유튜브 요리 영상에서 실행 가능한 운반 계획을 성공적으로 생성했다.
  • 두 명의 참가자가 협업하는 세 편의 전장 영상에서 시스템이 견고한 성능을 보였다.
  • 학습된 계획은 오픈소스 플랫폼을 통해 시뮬레이션 환경과 실제 로봇 암에서 성공적으로 실행되었다.
  • 언어적이고 계층적인 동작 표현 방식은 다양한 운반 동작과 물체 상호작용에 대한 일반화를 가능하게 했다.
  • 프레임워크는 학습된 계획을 실제 로봇 시스템으로의 이식 가능성을 보장하여 실용적 적용 가능성을 입증했다.
  • 오픈소스 플랫폼은 향후 웹 기반 로봇 학습 분야의 연구를 위한 재현 가능성과 확장성 향상을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.