Skip to main content
QUICK REVIEW

[논문 리뷰] Scaling Robot Learning with Semantically Imagined Experience

Tianhe Yu, Ted Xiao|arXiv (Cornell University)|2023. 02. 22.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 실제 세계 데이터를 수집하지 않고도 의미 있는 의미적, 사진과 유사한 데이터 증강을 위한 로봇 학습을 위해 텍스트-이미지 확산 모델을 사용하는 ROSIE라는 방법을 제안한다. 자연어 프롬프트를 사용해 물체, 배경 및 간섭 요소를 보정함으로써 ROSIE는 정책이 예측할 수 없는 작업과 혼잡한 환경에 일반화하고, 분포 외 시나리오에서 성공 검출 F1 스코어를 0.19에서 0.57로 크게 향상시킨다.

ABSTRACT

Recent advances in robot learning have shown promise in enabling robots to perform a variety of manipulation tasks and generalize to novel scenarios. One of the key contributing factors to this progress is the scale of robot data used to train the models. To obtain large-scale datasets, prior approaches have relied on either demonstrations requiring high human involvement or engineering-heavy autonomous data collection schemes, both of which are challenging to scale. To mitigate this issue, we propose an alternative route and leverage text-to-image foundation models widely used in computer vision and natural language processing to obtain meaningful data for robot learning without requiring additional robot data. We term our method Robot Learning with Semantically Imagened Experience (ROSIE). Specifically, we make use of the state of the art text-to-image diffusion models and perform aggressive data augmentation on top of our existing robotic manipulation datasets via inpainting various unseen objects for manipulation, backgrounds, and distractors with text guidance. Through extensive real-world experiments, we show that manipulation policies trained on data augmented this way are able to solve completely unseen tasks with new objects and can behave more robustly w.r.t. novel distractors. In addition, we find that we can improve the robustness and generalization of high-level robot learning tasks such as success detection through training with the diffusion-based data augmentation. The project's website and videos can be found at diffusion-rosie.github.io

연구 동기 및 목표

  • 로봇 데이터 수집의 스케일링 문제를 해결하기 위해 인간의 시연나 엔지니어링된 자율 시스템에 의존하는 데서 기인한 비용과 시간 소모 문제를 해결하기 위해.
  • 상용 텍스트-이미지 확산 모델이 로봇 학습을 위한 다양하고 현실적이며 의미적으로 유의미한 훈련 데이터를 생성할 수 있는지 탐색하기 위해.
  • 분포 외(OOD) 환경에서 새로운 물체와 혼잡한 장면이 있는 경우 정책과 성공 검출기의 강건성과 일반화 능력을 향상시키기 위해.
  • 신규 작업에 대해 제로샷 적응이 가능한 일반 목적의 데이터 증강 프레임워크를 개발하기 위해.

제안 방법

  • 최신 텍스트-이미지 확산 모델(예: DALL-E 2, Stable Diffusion)을 사용해 기존 로봇 시연 이미지의 의미적 보정을 수행한다.
  • 프롬프트 엔지니어링을 통해 자연어 지시문을 분석하여 수정할 영역(예: 목표 물체, 간섭 요소, 배경 등)을 식별한다.
  • 텍스트 유도 보정을 적용해 특정 이미지 영역을 교체하면서도 나머지 장면, 즉 로봇 자세와 물체 抓지 상태를 유지한다.
  • 프롬프트 변형을 통해 물체의 정체성, 색상, 장면 맥락을 체계적으로 변화시켜 다양한 현실적인 훈련 데이터를 생성한다.
  • 실제 데이터와 의미적으로 일관된 합성 데이터를 조합하여 증강된 데이터셋으로 하류 모델(예: 정책, 성공 검출기)을 훈련시킨다.
  • CLIP 기반의 성공 검출기를 사용해 새로운 간섭 요소와 새로운 물체가 있는 OOD 테스트 세트에서의 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1텍스트 유도 이미지 생성 모델은 로봇 학습에서 제로샷 일반화를 향상시키기 위해 현실적이며 의미적으로 중요한 데이터 증강을 생성할 수 있는가?
  • RQ2ROSIE는 추가적인 실제 세계 데이터 수집 없이도 새로운 물체와 예측 불가능한 환경에 대한 정책 일반화 능력을 어느 정도 향상시킬 수 있는가?
  • RQ3ROSIE는 새로운 간섭 요소가 있는 분포 외(OOD) 시나리오에서 성공 검출과 같은 고수준 작업의 강건성을 향상시키는가?
  • RQ4확산 모델을 사용한 증강의 규모가 분포 내 및 OOD 벤치마크에서 하류 성능에 어떤 영향을 미치는가?

주요 결과

  • ROSIE는 OOD 테스트 세트에서 성공 검출 F1 스코어를 증강 없이 0.19에서 ROSIE 전체 증강 시 0.57로 크게 향상시켜 새로운 간섭 요소에 대한 강건성을 뚜렷이 입증한다.
  • 분포 내 작업에서는 성능이 안정적으로 유지되며(F1 ≈ 0.66), ROSIE가 본래의 분포에서 성능을 떨어뜨리지 않는다는 것을 시사한다.
  • ROSIE로 증강된 데이터로 훈련된 정책은 원래 훈련 데이터에 없던 완전히 새로운 작업, 예를 들어 복숭아 근처에 노란 색 칩 봉지를 옮기는 것 등에도 성공적으로 일반화된다.
  • 이 방법은 공간적·의미적 일관성을 유지하는 효과적인 데이터 증강을 가능하게 하여, 시각적 변화가 있더라도 작업 관련 특징을 학습할 수 있도록 한다.
  • ROSIE는 시뮬레이션 또는 운동 데이터를 요구하지 않으며, 오직 이미지 수준의 의미적 증강에 의존함으로써 일반화 능력을 향상시킨다.
  • 시간적 일관성이 정책 학습에서 유지되며, 로보틱스 트랜스포머 아키텍처에서 안정된 성능을 보여, 프레임 단위 증강에도 불구하고 효과적인 결과를 얻었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.