[논문 리뷰] Scaling Robot Supervision to Hundreds of Hours with RoboTurk: Robotic Manipulation Dataset through Human Reasoning and Dexterity
이 논문은 실시간 저지연 웹 기반 제어와 안전성 및 다중 센서 스트림 동기화 메커니즘을 통해 고도로 다양하고 고품질의 시연를 유지하면서도, 54명의 사용자와 3개의 복잡한 작업—물체 탐색, 타워 구축, 빨래 정리—를 통해 111시간 이상의 인간 감독 하에 로봇 조작 데이터 수집을 가능하게 하는 원격 원격 조작 플랫폼인 RoboTurk을 제시한다.
Large, richly annotated datasets have accelerated progress in fields such as computer vision and natural language processing, but replicating these successes in robotics has been challenging. While prior data collection methodologies such as self-supervision have resulted in large datasets, the data can have poor signal-to-noise ratio. By contrast, previous efforts to collect task demonstrations with humans provide better quality data, but they cannot reach the same data magnitude. Furthermore, neither approach places guarantees on the diversity of the data collected, in terms of solution strategies. In this work, we leverage and extend the RoboTurk platform to scale up data collection for robotic manipulation using remote teleoperation. The primary motivation for our platform is two-fold: (1) to address the shortcomings of prior work and increase the total quantity of manipulation data collected through human supervision by an order of magnitude without sacrificing the quality of the data and (2) to collect data on challenging manipulation tasks across several operators and observe a diverse set of emergent behaviors and solutions. We collected over 111 hours of robot manipulation data across 54 users and 3 challenging manipulation tasks in 1 week, resulting in the largest robot dataset collected via remote teleoperation. We evaluate the quality of our platform, the diversity of demonstrations in our dataset, and the utility of our dataset via quantitative and qualitative analysis. For additional results, supplementary videos, and to download our dataset, visit http://roboturk.stanford.edu/realrobotdataset .
연구 동기 및 목표
- 고품질 데이터를 유지하면서 수백 시간에 이르는 인간 감독 하의 로봇 조작 데이터 수집을 스케일링하는 것.
- 자기 감독 방법의 한계를 해결하기 위해, 이는 고노이즈 데이터를 생성하며, 전통적인 인간 시연의 경우 스케일이 제한됨을 해결하는 것.
- 이해력과 정교함이 요구되는 어려운 조작 작업에서 다양하고 고품질의 시연를 수집하는 것.
- 시뮬레이션에서 실제 로봇으로의 RoboTurk 플랫폼 확장으로, 하드웨어 지연, 안전성, 다중 센서 데이터 동기화를 처리하는 것.
- 모방 학습, 보상 함수 설계, 계층적 계획 수립에 사용하기 위해, 원격 원격 조작를 통해 알려진 최대 규모의 데이터셋을 구축하는 것.
제안 방법
- 웹 브라우저와 스마트폰 모션 컨트롤러를 사용하여 실제 로봇 원격 조작를 지원하도록 RoboTurk 플랫폼을 확장하였다.
- 네트워크 및 액추에이터 지연을 관리하기 위해 영상 스트리밍과 액추에이션 피드백을 포함한 저지연 원격 제어 파이프라인을 구현하였다.
- 초보자 사용자도 안전하게 로봇을 운용할 수 있도록 운영 중 안전 메커니즘을 설계하였다.
- 동시 데이터 수집 중 여러 로봇에서 발생하는 다중 레이트 센서 스트림(예: RGB, 관절 상태)을 동기화하였다.
- 인지적 추론과 정교한 운동 제어가 요구되는 세 가지 새로운 조작 작업—물체 탐색, 타워 구축, 빨래 정리—을 도입하였다.
- 후속 보상 함수 학습을 위해 시연의 시간적 및 의미적 구조를 포착하기 위해 트리플릿 손실 기반 임베딩 학습을 적용하였다.
실험 결과
연구 질문
- RQ1원격 원격 조작 플랫폼은 실제 로봇에서 고품질 데이터를 손상시키지 않고도 수백 시간에 이르는 인간 감독 데이터 수집을 스케일링할 수 있는가?
- RQ2이해력과 정교함이 요구되는 복잡한 조작 작업에서 인간의 해결 전략 다양성이 어떻게 나타나는가?
- RQ3수집된 데이터셋은 보상 함수 학습 및 정책 모방과 같은 후속 학습 작업을 지원할 수 있는가?
- RQ4실제 로봇으로의 원격 조작 스케일링에서의 주요 과제는 무엇이며, 이를 커뮤니티 기반 환경에서 어떻게 해결할 수 있는가?
- RQ5시연에서 학습된 임베딩이 작업 진행 상황과 의미적 유사성을 얼마나 잘 포착할 수 있는가?
주요 결과
- Rob오투크 플랫폼은 54명의 사용자와 함께 1주일 동안 111시간 이상의 로봇 조작 데이터를 성공적으로 수집하여, 이전의 인간 감독 데이터셋 대비 규모가 10배 이상 증가하였다.
- 참가자들은 스마트폰 기반 원격 조작 인터페이스에 신속히 적응하여 복잡한 작업에서 효율적이고 다양한 데이터 수집이 가능했다.
- 데이터셋은 높은 다양성을 보였으며, 각 작업에서 다양한 접근 방식이 관찰되었고, 빨래 정리 작업에서는 다양한 접기 및 캐치 기술이 포함되었다.
- 트리플릿 손실을 통해 학습된 프레임 임베딩은 작업 의미론과 시간적 진행을 잘 포착하였으며, 목표 프레임에 가까운 거리가 작을수록 작업 완료를 의미하고, 더 큰 거리는 초기 단계 또는 성공하지 못한 단계를 나타내었다.
- 임베딩 공간은 잠재적인 조밀한 보상 함수로서의 유용성을 보였으며, 성공적인 종료 프레임에 가까운 거리가 작업 진행 상황과 관련성이 있었다.
- 데이터셋의 일부(수건 들어 올리기 중심)에 대해 행동 복제를 수행한 결과 부분적인 성공을 거두었지만, 전체 데이터셋 학습은 솔루션의 다양성으로 인해 실패하였으며, 향후 다중 모odal 시연를 다루기 위한 연구가 필요함을 시사하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.