Skip to main content
QUICK REVIEW

[논문 리뷰] Balance Between Efficient and Effective Learning: Dense2Sparse Reward Shaping for Robot Manipulation with Environment Uncertainty

Yongle Luo, Kun Dong|arXiv (Cornell University)|2020. 03. 05.
Reinforcement Learning in Robotics참고 문헌 44인용 수 5
한 줄 요약

이 논문은 빠른 초기 학습을 위한 조밀한 보상과 최종 정책 개선을 위한 희박한 보상의 조합을 통한 보상 형상화 방법인 Dense2Sparse를 제안한다. 이는 환경의 불확실성 하에서 로봇 조작 작업에서 뛰어난 샘플 효율성과 강건성을 달성한다. 이 방법은 독립적인 조밀한 또는 희박한 보상보다 우수한 성능을 보이며, 특히 센서 노이즈가 존재할 경우에 유의미한 성능 향상을 보이며, 높은 성공률과 낮은 분산을 보이며 거의 오라클 성능에 도달한다.

ABSTRACT

Efficient and effective learning is one of the ultimate goals of the deep reinforcement learning (DRL), although the compromise has been made in most of the time, especially for the application of robot manipulations. Learning is always expensive for robot manipulation tasks and the learning effectiveness could be affected by the system uncertainty. In order to solve above challenges, in this study, we proposed a simple but powerful reward shaping method, namely Dense2Sparse. It combines the advantage of fast convergence of dense reward and the noise isolation of the sparse reward, to achieve a balance between learning efficiency and effectiveness, which makes it suitable for robot manipulation tasks. We evaluated our Dense2Sparse method with a series of ablation experiments using the state representation model with system uncertainty. The experiment results show that the Dense2Sparse method obtained higher expected reward compared with the ones using standalone dense reward or sparse reward, and it also has a superior tolerance of system uncertainty.

연구 동기 및 목표

  • 로봇 조작을 위한 딥 강화학습(DRL)에서 학습 효율성과 효과성 간의 상충 관계를 해결한다.
  • 불확실한 환경에서 희박한 보상(느린 수렴)과 조밀한 보상(보상 노이즈에 민감함)의 한계를 극복한다.
  • 빠른 학습을 위한 조밀한 피드백과 노이즈에 강건한 정책 개선을 위한 희박한 피드백을 활용하는 보상 형상화 전략을 개발한다.
  • 카메라 정렬 불일치와 같은 시스템 불확실성 하에서 성능을 평가하여 실제 세계 유사 조건에서의 강건성을 입증한다.

제안 방법

  • 단일 카메라 영상에서 목표 물체의 위치를 추정하기 위해 ResNet34 기반 상태 표현 모델을 사용하여 조밀한 보상 계산을 가능하게 한다.
  • 초기 학습 단계에서 연속적인 피드백을 통해 비최적이지만 실행 가능한 정책으로 유도하기 위해 조밀한 보상을 적용한다.
  • 충분한 경험을 축적한 후에 점진적으로 조밀한 보상에서 희박한 보상으로 전환하여 노이즈 없는 정책 개선을 가능하게 한다.
  • 오프-폴리시 DRL 알고리즘과 통합하여 표준 학습 파이프라인과의 호환성을 유지한다.
  • 성공적인 트레이젝터리를 저장하는 경험 재생 버퍼를 활용하여, 희박한 보상 단계에서 노이즈가 있는 조밀한 보상으로 인한 편향을 수정한다.
  • 이중 단계 학습 스케줄을 구현한다: 탐색을 위한 조밀한 보상 단계와 이후 최적화를 위한 희박한 보상 단계

실험 결과

연구 질문

  • RQ1하이브리드 보상 형상화 전략은 로봇 조작을 위한 DRL에서 학습 효율성과 효과성을 균형 잡을 수 있는가?
  • RQ2Dense2Sparse는 센서 노이즈 또는 카메라 정렬 오차와 같은 시스템 불확실성 하에서 어떻게 성능을 발휘하는가?
  • RQ3조밀한 보상에서 희박한 보상으로 전환하는 것이, 단독으로 하나의 보상 유형을 사용하는 것보다 최종 정책 성능을 향상시키는가?
  • RQ4Dense2Sparse는 복잡한 조작 작업에서 상태 및 보상 신호의 노이즈에 얼마나 민감한가?

주요 결과

  • Dense2Sparse 방법은 리프팅 작업에서 최종 에피소드 보상 약 350을 달성하여, 독립적인 조밀한 보상(약 260)과 희박한 보상(약 260)보다 유의미하게 뛰어난 성능을 보였다.
  • Dense2Sparse 정책의 성공률은 표준편차가 거의 0에 가까운 99%에 도달하여 오라클 정책과 동일했으며, 독립적인 조밀한 및 희박한 방법은 각각 65%와 60%의 성공률을 기록했다.
  • 시스템 불확실성이 증가함에 따라(예: 카메라 정렬 오프셋), Dense2Sparse는 안정적인 수렴 속도와 성능 유지를 보이며 노이즈에 대한 강건성을 입증했다.
  • 이 방법은 보상 오차 누적에 대해 뛰어난 내성성을 보이며, 조밀한 보상 전용 학습에서 흔히 발생하는 비최적 정책을 피했다.
  • 제거 실험을 통해 이중 단계 전략(조밀한 다음 희박한)이 각각 독립적으로 사용될 경우보다 더 빠른 수렴과 더 나은 최종 성능을 가능하게 한다는 점을 확인했다.
  • 부정확한 상태 표현을 사용함에도 불구하고 복잡한 작업에서 거의 오라클 성능을 달성함으로써, 이 방법이 불확실한 환경에서 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.