Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning on Variable Impedance Controller for High-Precision Robotic Assembly

Jianlan Luo, Eugen Solowjow|arXiv (Cornell University)|2019. 03. 04.
Robot Manipulation and Learning참고 문헌 38인용 수 20
한 줄 요약

이 논문은 힘/토크(F/T) 피드백을 운영 공간 제어기와 통합한 강화학습(RL) 프레임워크를 제안하여 고정밀 로봇 조립을 가능하게 한다. F/T 측정치를 활용해 적응형 임피던스 제어를 수행할 수 있도록 신경망 정책을 훈련시킴으로써, 환경 변화에 대해 강건한 일반화 성능을 달성하였으며, 성공률에서 베이스라인들을 능가하였고, 밀착_tolerance 기어 조립 작업에서 인간과 유사한 힘 기반 삽입 전략을 보여주었다.

ABSTRACT

Precise robotic manipulation skills are desirable in many industrial settings, reinforcement learning (RL) methods hold the promise of acquiring these skills autonomously. In this paper, we explicitly consider incorporating operational space force/torque information into reinforcement learning; this is motivated by humans heuristically mapping perceived forces to control actions, which results in completing high-precision tasks in a fairly easy manner. Our approach combines RL with force/torque information by incorporating a proper operational space force controller; where we also exploit different ablations on processing this information. Moreover, we propose a neural network architecture that generalizes to reasonable variations of the environment. We evaluate our method on the open-source Siemens Robot Learning Challenge, which requires precise and delicate force-controlled behavior to assemble a tight-fit gear wheel set.

연구 동기 및 목표

  • 기존 제어기들이 실패하는 철저한 허용 오차(예: <0.1 mm) 조건 하에서 고정밀 로봇 조립 과제를 해결한다.
  • 운영 공간의 힘/토크 피드백 통합이 접촉이 많은 조작 과제에서 샘플 효율성과 정책 성능을 향상시키는지 조사한다.
  • 결정 과정에서 F/T 센서 데이터를 명시적으로 활용하여 국소적 환경 변화에 일반화 가능한 신경망 아키텍처를 개발한다.
  • 강화학습이 수동적인 힘 제어 규칙에 의존하지 않고도 적응형 유연성 행동을 자율적으로 학습할 수 있는지 보여준다.
  • 기반 위치 이동과 같은 교란 조건 하에서의 일반화 능력을 평가한다.

제안 방법

  • 정책 사전 훈련을 위한 고품질 디모너이션을 생성하기 위해 국소 경로 최적화기로 반복적 선형-정규분포 가우시안(iLQG) 제어기를 사용한다.
  • 로봇 상태와 F/T 센서 읽기 값을 입력으로 받는 신경망 정책을 설계하며, F/T 데이터는 분포 불일치를 방지하기 위해 전용 특징 추출 헤드를 거쳐 처리된다.
  • iLQG 정책을 전역적이고 엔드 투 엔드로 미분 가능한 신경망 정책으로 압축하기 위해 가이드드 정책 서치(GPS)를 사용한다.
  • 운영 공간 역학에서 유도된 Pfaffian 제약 조건을 정책의 행동 공간에 통합하여 물리적 일관성을 도입한다.
  • 성공은 작업 완료 시에만 신호가 주어지는 희소 밀도 보상 형태로 정책을 훈련시킨다.
  • 도메인 랜덤라이제이션과 교란 테스트를 적용하여 기반 위치 이동 조건 하에서의 강건성과 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1운영 공간 제어에 힘/토크 피드백을 통합하면 고정밀 로봇 조립에서 샘플 효율성과 정책 성능이 향상되는가?
  • RQ2강화학습이 수동적인 힌트 없이도 적응형 임피던스 행동을 자율적으로 학습할 수 있는가?
  • RQ3F/T 센서 데이터의 명시적 처리가 기반 위치 이동과 같은 국소적 환경 변화에 일반화하는 데 기여하는가?
  • RQ4제안된 신경망 아키텍처는 F/T 직접 입력 또는 iLQG 기준선 대비 교란 조건 하에서 강건성과 성공률 측면에서 어떻게 비교되는가?
  • RQ5학습된 정책은 예측할 수 없는 구성 조건에서도 고정밀 성능을 유지하면서 일반화 가능한가?

주요 결과

  • 기반 위치가 1cm 이동한 상황에서 제안된 방법은 90% 성공률(10번 중 9번)을 기록했으며, iLQG 기준선(80%)과 F/T 첫 번째 레이어 기준선(0%)을 초월했다.
  • 기반 위치가 2cm 이동한 상황에서 제안된 방법은 80% 성공률(10번 중 8번)을 기록했으며, iLQG는 50%였고, F/T 첫 번째 레이어 기준선은 0%였다.
  • 기반 위치가 5cm 이동한 상황에서 제안된 방법은 60% 성공률(10번 중 6번)을 유지했으며, iLQG는 60%로 유지되었지만 변동성이 더 높았고, F/T 첫 번째 레이어 기준선은 완전히 실패했다.
  • 신경망의 첫 번째 레이어에 F/T 데이터를 직접 입력하면 훈련 불안정성(큰 KL 발산)과 나쁜 행동(무작위 운동 포함)이 발생하여, 체계적인 F/T 특징 처리의 필요성을 입증했다.
  • 학습된 정책은 F/T 측정치에서 접촉 단계 동안 특징적인 힘과 토크 피크를 보이며 인간과 유사한 힘 기반 삽입 패턴을 자율적으로 발견했다.
  • 교란 조건 하에서 iLQG보다 신경망 정책이 더 우수한 일반화 성능을 보였으며, 이는 F/T 정보를 능동적으로 활용함으로써 목표 기반 LQR나 iLQG만으로는 달성할 수 없는 강건한 적응 능력이 가능하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.