Skip to main content
QUICK REVIEW

[논문 리뷰] A Learning Framework for High Precision Industrial Assembly

Yongxiang Fan, Jieliang Luo|arXiv (Cornell University)|2018. 09. 23.
Reinforcement Learning in Robotics참고 문헌 13인용 수 4
한 줄 요약

이 논문은 모델 기반 궤적 최적화와 액터-크리틱 강화 학습을 결합한 하이브리드 학습 프레임워크를 제안하여 고정밀 산업 조립을 가능하게 한다. 최적 궤적을 준지도자로 사용하고, 정책 학습의 안정성을 확보하기 위해 크리틱 네트워크를 활용함으로써, 순수 강화 학습에 비해 수렴 속도가 빠르고 더 뛰어난 안정성을 확보하며 데이터 요구량을 줄이고, 고강성 시스템에서의 힘/토크 피드백 환경에서도 안정성을 향상시킨다.

ABSTRACT

Automatic assembly has broad applications in industries. Traditional assembly tasks utilize predefined trajectories or tuned force control parameters, which make the automatic assembly time-consuming, difficult to generalize, and not robust to uncertainties. In this paper, we propose a learning framework for high precision industrial assembly. The framework combines both the supervised learning and the reinforcement learning. The supervised learning utilizes trajectory optimization to provide the initial guidance to the policy, while the reinforcement learning utilizes actor-critic algorithm to establish the evaluation system even the supervisor is not accurate. The proposed learning framework is more efficient compared with the reinforcement learning and achieves better stability performance than the supervised learning. The effectiveness of the method is verified by both the simulation and experiment.

연구 동기 및 목표

  • 수동 궤적 튜닝에 의존하고 환경의 불확실성에 민감한 전통적 조립 방법의 한계를 해결하기 위해.
  • 고강성 로봇 역학과 힘/토크 피드백이 포함된 고정밀 조립 작업에서의 데이터 효율성과 학습 안정성을 향상시키기 위해.
  • 모델 기반 최적화와 모델 자유 강화 학습의 장점을 융합하여 보다 우수한 성능과 신뢰성을 확보하는 학습 프레임워크를 개발하기 위해.
  • 피스-인-홀 및 유사 작업에서 구멍의 위치, 형상, 간극의 변화에 대해 견고한 일반화를 가능하게 하기 위해.

제안 방법

  • 최적 궤적을 준지도자로 사용하고, 위치 및 힘/토크 피드백을 활용한 궤적 최적화를 통해 초기 최적 궤적을 생성한다.
  • 최적 궤적에서의 지도 학습과 크리틱 네트워크의 정책 기반 강화 학습 업데이트를 병행하여 액터-크리틱 네트워크를 학습시킨다.
  • 크리틱 네트워크는 준지도자의 출력과 실시간 정책 탐색을 기반으로 Q-값을 학습하여 정책 품질에 대한 안정적인 기준 평가를 제공한다.
  • 액터 네트워크는 지도 지도에 기반한 가이드라인과 정책 기반 강화 학습 신호를 조합하여 업데이트함으로써 수렴성과 안정성을 향상시킨다.
  • 하이브리드 학습 전략을 통해 무작위 탐색에 대한 의존도를 감소시켜 탐색 공간을 좁히고 데이터 효율성을 향상시킨다.
  • 정책에서 유도된 속도 명령을 실행하기 위해 저수준 추적 제어기를 통합하여 최종 액추에이터의 정확한 운동을 보장한다.

실험 결과

연구 질문

  • RQ1모델 기반 최적화와 액터-크리틱 강화 학습을 융합한 하이브리드 학습 프레임워크가 고정밀 조립에서 데이터 효율성과 안정성 향상에 기여하는가?
  • RQ2크리틱 네트워크의 통합이 고강성 로봇 역학과 힘/토크 피드백으로 인한 궤적 최적화의 불안정성을 어떻게 완화하는가?
  • RQ3학습된 정책이 구멍의 위치, 형상, 간극의 변화에 대해 얼마나 잘 일반화되는가?
  • RQ4시뮬레이션 및 실제 실험에서 순수 DDPG, TD3, SAC와 비교해 본 프레임워크의 샘플 효율성과 수렴 속도는 어떠한가?

주요 결과

  • 가이드드-DDPG는 레고 브릭 삽입 작업에서 800개의 롤아웃 만으로 성공을 달성했고, 순수 DDPG는 5,000개의 롤아웃이 필요했으며 성능이 일관되지 못했다.
  • 제안된 방법은 학습 시간을 83분(DDPG)에서 37.3분으로 단축시키고, 롤아웃 수를 7,000회에서 1,500회로 줄여 데이터 및 시간 효율성에서 뚜렷한 향상을 보였다.
  • 정책은 0.5 mm의 구멍 위치 불확실성, 최대 5 mm의 오프셋, 4×2 브릭 및 완전하지 않은 구멍을 가진 실린더 등 다양한 형상의 브릭을 성공적으로 삽입했다.
  • 간극 변화에 대해 일반화 성능을 보였으며, 0.1 mm, 1 μm, 0 μm 간극을 가진 구멍에도 성공적으로 삽입하여 기하학적 불확실성에 대한 견고성을 입증했다.
  • 실험 결과, 가이드드-DDPG는 1.5시간 내에 3 mm 탐색 반경에서 정책을 발견했고, 순수 DDPG는 1 mm 반경에서 정책을 발견하는 데 2시간이 소요되어 더 넓고 효율적인 탐색을 보였다.
  • 크리틱 네트워크는 궤적 최적화기의 정확성 부족을 보완하여 학습을 안정화시키고 정책 붕괴를 방지함으로써 신뢰성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.