[논문 리뷰] Planning with a Receding Horizon for Manipulation in Clutter using a Learned Value Function
이 논문은 혼잡한 환경에서 실시간, 피드백 기반의 조작을 위해 학습된 가치 함수를 갖춘 후퇴 계획자(RHP)를 제안한다. 샘플링 기반 계획자로 초도 계획을 생성하고, 강화학습을 통해 가치 함수를 보정함으로써, 물리 모델링 오차와 접촉이 풍부한 상호작용이 존재하는 현실 세계의 불확실성 하에서도 열린 루프 방법보다 뛰어난 성능을 보이는 빠르고 반응성이 뛰어난 계획 수립이 가능해진다. 물리적 파rameter 불일치가 존재하는 상황에서도 높은 성공률을 달성한다.
Manipulation in clutter requires solving complex sequential decision making problems in an environment rich with physical interactions. The transfer of motion planning solutions from simulation to the real world, in open-loop, suffers from the inherent uncertainty in modelling real world physics. We propose interleaving planning and execution in real-time, in a closed-loop setting, using a Receding Horizon Planner (RHP) for pushing manipulation in clutter. In this context, we address the problem of finding a suitable value function based heuristic for efficient planning, and for estimating the cost-to-go from the horizon to the goal. We estimate such a value function first by using plans generated by an existing sampling-based planner. Then, we further optimize the value function through reinforcement learning. We evaluate our approach and compare it to state-of-the-art planning techniques for manipulation in clutter. We conduct experiments in simulation with artificially injected uncertainty on the physics parameters, as well as in real world tasks of manipulation in clutter. We show that this approach enables the robot to react to the uncertain dynamics of the real world effectively.
연구 동기 및 목표
- 실제 물리 동역학이 시뮬레이션 모델과 다를 수 있는 혼잡한 물리 기반 환경에서 운동 계획을 실행하는 데 도전 과제를 해결하기 위해.
- 물리 모델링 정확도 부족과 접촉이 풍부한 상호작용으로 인해 실패하는 열린 루프 계획의 한계를 극복하기 위해.
- 환경 불확실성에 실시간으로 반응하는 빠른 피드백 기반 계획 시스템을 개발하기 위해.
- 수동으로 수립한 히우리스틱 없이 효율적인 후퇴 계획을 위한 비용-도달 예측을 위한 강건한 데이터 기반 가치 함수를 학습하기 위해.
- 초기 사전 훈련 이후 종단 간 강화학습을 통한 가치 함수의 최적화를 통해 계획 성능을 향상시키기 위해.
제안 방법
- 시뮬레이션에서 전문가 시연를 생성하기 위해 샘플링 기반의 키노-다이내믹 RRT 계획자를 사용하여 사전 훈련을 위한 상태-행동-가치 쌍을 생성한다.
- 깊이 신경망(DNN)을 훈련시켜 상태-행동 쌍의 가치를 예측하고, 해당 상태에서의 기대 비용-도달을 추정한다.
- 짧은 시간 간격 동안 계획을 수행하는 후퇴 계획자(RHP)를 구현하며, DNN로 예측한 가치 함수를 히우리스틱으로 사용해 행동 선택을 유도한다.
- 실제 RHP 실행 결과와 예측을 일치시키기 위해 강화학습(PPO)을 사용해 DNN 가치 함수를 보정함으로써 강건성을 향상시킨다.
- 환경의 업데이트된 관측치를 기반으로 매 단계마다 재계획을 수행함으로써 실시간 피드백을 통합하고 피드백 기반 적응을 가능하게 한다.
- 평가 중에 실제 세계의 불확실성을 시뮬레이션하기 위해 Box2D 물리 시뮬레이션에 객체 파라미터(형상, 마찰계수, 밀도)에 가우시안 노이즈를 주입한다.
실험 결과
연구 질문
- RQ1학습된 가치 함수는 혼잡한 조작 작업에서 후퇴 계획의 효율성과 강건성을 향상시키는가?
- RQ2사전 훈련된 가치 함수를 강화학습으로 보정함으로써 물리 모델링 불확실성 하에서의 성능에 어떤 영향을 미치는가?
- RQ3학습된 가치 함수를 갖춘 피드백 기반 RHP는 실제 실행 환경에서 열린 루프 계획보다 얼마나 뛰어나게 성능을 발휘하는가?
- RQ4데이터 기반 가치 함수는 복잡한 조작 작업에서 수동으로 설계한 히우리스틱이나 보상 형상화가 필요 없도록 할 수 있는가?
- RQ5계획 수직과 롤아웃 수의 선택은 불확실한 환경에서 성공률과 계산 시간 사이의 트레이드오프에 어떤 영향을 미치는가?
주요 결과
- 학습된 가치 함수를 갖춘 RHP(RHP-66)는 물리적 파rameter 불일치가 30%에 이르는 높은 불확실성 하에서도 96%의 성공률을 기록했으며, 동일 조건에서 열린 루프 키노-다이내믹 계획자는 44%로 떨어졌다.
- 계획 수직이 6이고 롤아웃 수가 66인 RHP-66는 모든 불확실성 수준에서 가장 높은 성공률(96%)을 기록했으며, 더 긴 수직과 충분한 롤아웃 수의 효과를 입증했다.
- 성공적인 실행 당 평균 계산 시간은 2초 이내로 유지되어 강화학습을 사용함에도 불구하고 거의 실시간 작동이 가능했다.
- UR5 로봇에서의 실제 실험을 통해 방법의 강건성을 확인했으며, RHP는 테스트한 세 가지 작업 전부에서 성공했고, 열린 루프 계획자는 세 번 중 두 번 실패했다.
- 샘플링 기반 계획에 기반한 사전 훈련과 PPO를 통한 보정을 통해 학습된 가치 함수는 초기 DNN만으로는 달성할 수 없었던 실제 동역학에 대한 일반화 능력을 확보했다.
- 지속적인 재계획을 통해 실시간 관측치를 기반으로 실시간으로 예측 불가능한 물리적 행동(예: 물체 형상 불일치)에 적응할 수 있는 뛀아난 적응성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.