Skip to main content
QUICK REVIEW

[논문 리뷰] Correcting Robot Plans with Natural Language Feedback

Pratyusha Sharma, Balakumar Sundaralingam|arXiv (Cornell University)|2022. 04. 11.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 로봇의 계획 수립 실패를 자연어 피드백을 통해 수정하기 위한 방법을 제안한다. 이 방법은 자연어 수정 사항을 기반으로 기존 계획 목표를 수정하는 잔여 비용 함수를 학습함으로써 작동한다. 제안된 방법은 하나 또는 두 개의 자연어 수정 사항을 사용할 경우 각각 81% 및 93%의 성공률을 기록하며, 예측할 수 없는 환경과 작업에 일반화된다.

ABSTRACT

When humans design cost or goal specifications for robots, they often produce specifications that are ambiguous, underspecified, or beyond planners' ability to solve. In these cases, corrections provide a valuable tool for human-in-the-loop robot control. Corrections might take the form of new goal specifications, new constraints (e.g. to avoid specific objects), or hints for planning algorithms (e.g. to visit specific waypoints). Existing correction methods (e.g. using a joystick or direct manipulation of an end effector) require full teleoperation or real-time interaction. In this paper, we explore natural language as an expressive and flexible tool for robot correction. We describe how to map from natural language sentences to transformations of cost functions. We show that these transformations enable users to correct goals, update robot motions to accommodate additional user preferences, and recover from planning errors. These corrections can be leveraged to get 81% and 93% success rates on tasks where the original planner failed, with either one or two language corrections. Our method makes it possible to compose multiple constraints and generalizes to unseen scenes, objects, and sentences in simulated environments and real-world environments.

연구 동기 및 목표

  • 모호하거나 부족하거나 잘못된 목표 사양으로 인한 로봇 계획 수립 실패 문제를 해결한다.
  • 전체 원격 제어나 지속적인 사용자 주의를 요구하지 않고도 민첩하고 실시간으로 로봇 행동을 수정할 수 있도록 한다.
  • 자연어에서 비용 함수로의 매핑을 종합적으로 학습함으로써, 새로운 환경, 물체, 자연어 명령어에 일반화되는 방법을 개발한다.
  • 최적화 기반 계획 수립에 자연어 피드백을 통합하기 위해 수정 사항을 잔여 비용 함수로 모델링한다.
  • 실행 중에 시간이 지남에 따라 다수의 언어 기반 제약 조건을 조합하고 확장 가능한 프레임워크를 제공한다.

제안 방법

  • 로봇의 현재 상태와 환경를 조건으로 하여, 시각적 관측치와 자연어 수정 사항에서 잔여 비용 함수를 예측하는 신경망을 훈련한다.
  • 최적화 기반 운동 계획 수립기에서 자연어 수정 사항을 기존 비용 함수의 수정으로 모델링함으로써 동적 재계획을 가능하게 한다.
  • 훈련된 비용 예측 모델의 지도 학습을 위해 시연 데이터와 참값 비용 맵을 조합하여 사용한다.
  • 예측된 비용 함수를 표준 운동 계획 수립 비용(예: 충돌 방지, 부드러움, 관절 한계)과 통합하여 궤적 최적화를 수행한다.
  • 실행 중에 시간이 지남에 따라 수정 사항을 순차적이고 변화 가능한 방식으로 적용하기 위해 비용 함수를 시간에 따라 쌓는다.
  • 시뮬레이션에서 훈련하고 실제 로봇 조작기에서 배포함으로써 시뮬레이션에서 실세계로의 전이를 활용하며, 새로운 물체와 환경에 대해 훈련 없이도 일반화된다.

실험 결과

연구 질문

  • RQ1기존 계획 수립기가 실패했을 때 자연어 피드백이 로봇 운동 계획을 효과적으로 수정하는 데 사용될 수 있는가?
  • RQ2학습된 언어-비용 모델이 새로운 물체, 새로운 환경, 그리고 분포를 벗어난 자연어 명령어에 얼마나 잘 일반화되는가?
  • RQ3여러 개의 자연어 수정 사항을 조합하여 로봇의 행동을 점진적으로 개선하고 작업 성공률을 높일 수 있는가?
  • RQ4언어 기반 수정 시스템은 얼마나 많은 원격 제어나 운동 피드백에 의존하지 않으면서도 높은 성능을 유지할 수 있는가?
  • RQ5시뮬레이션에서 훈련된 단일 모델이 보정 없이도 실제 세계의 로봇 행동을 성공적으로 수정할 수 있는가?

주요 결과

  • 단일 자연어 수정 사항을 사용할 경우 81%의 성공률을 기록하고, 두 개의 수정 사항을 사용할 경우 93%의 성공률을 기록하며, 이로 인해 효과적인 성공률이 94%에서 99%로 향상된다.
  • 모델은 새로운 물체와 새로운 환경으로 일반화되며, 시각적 입력과 언어 입력의 분포 이탈에 대해 강건함을 입증한다.
  • 이 프레임워크는 조합 가능하고 시간에 따라 변화하는 수정 사항을 지원하여, 사용자가 여러 자연어 명령어를 통해 반복적으로 로봇 행동을 개선할 수 있도록 한다.
  • 시스템은 시뮬레이션에서 실세계 작업으로의 전이가 성공적으로 이루어지며, 혼잡한 장면과 템플릿이 없는 자연어를 포함한 환경에서 재훈련 없이도 작동한다.
  • 원래 계획 수립기가 모호하거나 부족한 목표로 인해 실패했을 경우에도 자연어 수정 사항이 효과적이며, 전체 원격 제어 없이 복구가 가능하다.
  • 사용자 편의성과 사용자 주의 요구 수준 측면에서 기존의 조작기나 운동 피드백 방식보다 뛰어나며, 높은 작업 성공률을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.