Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Multi-Modal Policies for Industrial Assembly via Reinforcement Learning and Demonstrations: A Large-Scale Study

Jianlan Luo, Oleg Sushkov|arXiv (Cornell University)|2021. 03. 21.
Reinforcement Learning in Robotics참고 문헌 24인용 수 4
한 줄 요약

이 논문은 산업용 조립 작업을 위한 인간의 시연을 통합한 강건한 딥 강화학습 프레임워크인 SHIELD를 제안한다. NIST 기준 기준에서 13,000회의 시험에서 99.8%의 성공률을 기록하였다. 비정책 기반의 DDPGfD와 커리큘럼 학습, 시연 사전 지식을 융합함으로써, 이는 도전적인 삽입 작업, 특히 이동 대상과 막힘 없는 열쇠 삽입 작업에서 공학적 솔루션과 인간 성능을 초월하였다.

ABSTRACT

Over the past several years there has been a considerable research investment into learning-based approaches to industrial assembly, but despite significant progress these techniques have yet to be adopted by industry. We argue that it is the prohibitively large design space for Deep Reinforcement Learning (DRL), rather than algorithmic limitations per se, that are truly responsible for this lack of adoption. Pushing these techniques into the industrial mainstream requires an industry-oriented paradigm which differs significantly from the academic mindset. In this paper we define criteria for industry-oriented DRL, and perform a thorough comparison according to these criteria of one family of learning approaches, DRL from demonstration, against a professional industrial integrator on the recently established NIST assembly benchmark. We explain the design choices, representing several years of investigation, which enabled our DRL system to consistently outperform the integrator baseline in terms of both speed and reliability. Finally, we conclude with a competition between our DRL system and a human on a challenge task of insertion into a randomly moving target. This study suggests that DRL is capable of outperforming not only established engineered approaches, but the human motor system as well, and that there remains significant room for improvement. Videos can be found on our project website: https://sites.google.com/view/shield-nist.

연구 동기 및 목표

  • 학술적 강화학습과 산업 적용 간 격차를 해소하기 위해 DRL에 대한 산업 중심 기준을 정의한다.
  • 표준화된 NIST 조립 기준에서 전문 산업 통합 엔지니어링 솔루션과의 비교를 통해 DRL-시연 기반 접근법을 평가한다.
  • 기계 학습 기반 정책이 실제 산업적 조작 작업에서 공학적 시스템과 인간 성능을 초월할 수 있음을 입증한다.
  • 향후 산업 조작 분야 연구를 지원하기 위해 대규모 로봇 상호작용 데이터셋을 오픈소스로 제공한다.
  • 두 가지 매우 도전적인 작업, 즉 이동하는 대상에 HDMI 삽입 및 정렬되지 않은 자물쇠에 막힘 없는 열쇠 삽입에 대해 방법을 검증한다.

제안 방법

  • 인간 원격 조작 데이터로부터 다중 모드 정책을 학습하기 위해 비정책 기반의 딥 강화학습과 시연(DDPGfD)을 활용한다.
  • 커리큘럼 기반의 초기 자세 랜덤화를 적용하여 X/Y 오프셋을 0에서 0.5 cm로 점진적으로 증가시켜 초기 조건 변동성에 대한 강건성을 향상시킨다.
  • 주기적인 인간의 정책 보정을 통한 비동기적 온라인 학습을 실시하여 학습 안정성과 샘플 효율성을 향상시킨다.
  • 시각 정보와 힘-토크 피드백을 다중 모달 관측으로 통합하여 불확실한 환경에서 접촉이 많은 조작을 가능하게 한다.
  • 성공 신호와 삽입 향한 진전을 조합한 보상 형상화 메커니즘을 적용하여 탐색과 수렴을 장려한다.
  • 시각 관측을 인코딩하기 위해 VAE 기반 재구성 손실을 갖는 시각 모델을 사용하지만, 조명 변화나 혼잡함과 같은 환경 변화에서 성능 저하가 발생한다.

실험 결과

연구 질문

  • RQ1시연를 통한 학습을 거친 DRL 시스템이 표준 산업 기준에서 전문적으로 설계된 산업용 로봇 솔루션을 초월할 수 있는가?
  • RQ2단일 DRL 정책이 산업용 삽입 작업에서 다양한 초기 자세 오프셋에 대해 얼마나 일반화되는가?
  • RQ3학습 기반 시스템이 이동 대상에 삽입하는 것과 같은 복잡하고 동적인 조작 작업에서 인간 수준의 성능을 따라하거나 초월할 수 있는가?
  • RQ4센서 노이즈, 물체의 정렬 오류, 환경적 산만함 등 실제 세계의 변동성에 대해 이 방법은 얼마나 강건한가?
  • RQ5이 프레임워크는 기존 로봇 공학 솔루션이 너무 취약하거나 비용이 많이 드는 경우에 적합한 제약 없는 제조 환경에서의 구현을 가능하게 할 수 있는가?

주요 결과

  • SHIELD 에이전트는 NIST 조립 기준에서 13,000회의 시험에서 99.8%의 성공률을 기록하여 다양한 테스트 조건에서도 높은 신뢰성을 입증하였다.
  • 최대 0.5 cm의 초기 X/Y 오프셋이 있는 열쇠 삽입 작업에서 에이전트는 87%의 성공률을 기록했으며, 이는 2 mm 이내의 검색 범위를 갖는 업계 솔루션보다 뚜렷이 뛰어났다.
  • 랜덤으로 움직이는 대상에 HDMI 삽입 작업에서 1,637회의 시험에서 100%의 성공률을 기록했고, 인간의 사이클 타임과 동일했다.
  • 시스템은 최대 5 mm의 초기 오차를 처리할 수 있는 장거리 탐색 정책을 학습했으며, 상용 솔루션의 2 mm 범위를 초월했다.
  • 인간과의 비교 결과, 이동 대상 삽입 작업에서 에이전트는 사이클 타임과 성공률에서 인간 수준의 성능을 보였으며, 인간 수준의 강건성을 입증했다.
  • 오픈소스로 제공된 데이터셋에는 보상 레이블이 부여된 약 50시간 분량의 로봇 상호작용 데이터가 포함되어 있어, 향후 산업 조작 분야 연구의 벤치마킹과 재현 가능성을 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.