[논문 리뷰] Learning Insertion Primitives with Discrete-Continuous Hybrid Action Space for Robotic Assembly Tasks
이 논문은 강화학습을 사용하여 로봇 삽입 프리미티브를 학습하기 위해 이산-연속 동작 공간을 제안한다. 여기서 프리미티브 유형(이동, 회전, 삽입)과 연속적 파라미터(속도, 접촉력 임계값)가 함께 최적화된다. 이 방법은 쌍둥이 부드러운 다중패assing DQN(Twin-Smoothed Multi-pass DQN, TS-MP-DQN)으로, Q값 과소평가 문제를 줄이고 시뮬레이션에서 실제 환경으로의 전이 성공률이 93.3% 이상을 기록하며, 예측 불가능한 밀착 간극과 복잡한 형상의 조립에 대해 기존 방법들보다 뛰어난 성능을 보인다.
This paper introduces a discrete-continuous action space to learn insertion primitives for robotic assembly tasks. Primitive is a sequence of elementary actions with certain exit conditions, such as "pushing down the peg until contact". Since the primitive is an abstraction of robot control commands and encodes human prior knowledge, it reduces the exploration difficulty and yields better learning efficiency. In this paper, we learn robot assembly skills via primitives. Specifically, we formulate insertion primitives as parameterized actions: hybrid actions consisting of discrete primitive types and continuous primitive parameters. Compared with the previous work using a set of discretized parameters for each primitive, the agent in our method can freely choose primitive parameters from a continuous space, which is more flexible and efficient. To learn these insertion primitives, we propose Twin-Smoothed Multi-pass Deep Q-Network (TS-MP-DQN), an advanced version of MP-DQN with twin Q-network to reduce the Q-value over-estimation. Extensive experiments are conducted in the simulation and real world for validation. From experiment results, our approach achieves higher success rates than three baselines: MP-DQN with parameterized actions, primitives with discrete parameters, and continuous velocity control. Furthermore, learned primitives are robust to sim-to-real transfer and can generalize to challenging assembly tasks such as tight round peg-hole and complex shaped electric connectors with promising success rates. Experiment videos are available at https://msc.berkeley.edu/research/insertion-primitives.html.
연구 동기 및 목표
- 기존의 저수준 제어 동작 공간에서의 높은 탐색 어려움과 낮은 샘플 효율성 문제를 해결하기 위해.
- 매개변수화된 삽입 프리미티브를 통해 인간의 사전 지식을 통합함으로써 시뮬레이션-실세계 전이의 일반화 능력과 강건성을 향상시키기 위해.
- 이전의 프리미티브 기반 방법에서의 이산적 파라미터 선택의 한계를 극복하기 위해 연속적 파라미터 학습을 가능하게 하여 더 큰 유연성과 성능 향상을 이루기 위해.
- Q값 과소평가 문제를 줄이는 안정적이고 효율적인 딥 강화학습 알고리즘을 개발하여 매개변수화된 동작에 적용하기 위해.
제안 방법
- 삽입 프리미티브를 이산적 프리미티브 유형(이동, 회전, 삽입)과 연속적 파라미터(속도 벡터, 접촉력 임계값)를 조합한 하이브리드 동작으로 정의한다.
- 프리미티브 파라미터를 위한 연속적 파라미터 공간을 설계하여 고정된 이산적 선택 대신 무한한 가능한 구성으로 가능성을 확장한다.
- Q값 과소평가 문제를 줄이고 학습 안정성을 향상시키기 위해 쌍둥이 Q네트워크를 도입한 MP-DQN의 개선된 버전인 TS-MP-DQN을 제안한다.
- 실세계 실험에서 인터페이스 제어를 사용하여 기계적 유연성을 제공함으로써 시뮬레이션-실세계 전이 동안 강건성을 향상시킨다.
- 삽입 진행도를 기반으로 조밀한 보상 설계를 사용하여 시뮬레이션에서 정책을 학습하고, 접촉력을 종료 조건으로 삼는다.
- 실제 로봇에 직접 시뮬레이션에서 학습된 정책을 미세조정 없이 그대로 배포함으로써 제로샷 시뮬레이션-실세계 전이를 가능하게 한다.
실험 결과
연구 질문
- RQ1기존의 저수준 제어나 이산적 파라미터 프리미티브에 비해 하이브리드 이산-연속 동작 공간이 로봇 삽입 작업의 학습 효율성과 성공률 향상에 기여하는가?
- RQ2삽입 프리미티브에서의 연속적 파라미터 학습이 예측 불가능한 페그-홀 기하학적 형상과 밀착 간극에 대한 일반화 능력에 어떤 영향을 미치는가?
- RQ3제안된 TS-MP-DQN 알고리즘이 표준 MP-DQN에 비해 Q값 과소평가 문제를 어느 정도 줄이고 정책 안정성을 향상시키는가?
- RQ4특히 복잡하거나 높은 간극을 가진 작업에 대해, 시뮬레이션에서 학습된 정책이 미세조정 없이 실제 로봇으로 성공적으로 전이될 수 있는가?
주요 결과
- 제안된 방법은 세 가지 페그-홀 작업에서 시뮬레이션-실세계 전이 성공률가 93.3% 이상을 기록하며, 매개변수화된 동작을 사용하는 MP-DQN 및 연속적 속도 제어를 포함한 모든 기준 방법들을 능가했다.
- 재훈련 없이도 예측 불가능하고 도전적인 작업들, 예를 들어 0.05 mm 간극을 가진 밀착 원형 페그-홀과 복잡한 전기 커넥터에 대해 성공적으로 일반화되었으며, 높은 성공률를 기록했다.
- 삼각형 및 오각형 페그-홀 작업에서 TS-MP-DQN은 표준 MP-DQN보다 뛰어난 성능과 더 나은 학습 안정성을 보였다.
- 연속적 프리미티브 파라미터의 사용은 이산적 파라미터 기준 방법보다 유의미하게 높은 성공률과 더 나은 효율성을 달성했으며, 이는 초모수 설정에 민감하고 커버리지가 제한된 이산적 방법에 비해 유연성이 뛰어나다는 것을 시사한다.
- 실세계에서의 이산적 파라미터 기준 방법의 성능은 이전 연구에서 보고된 것보다 낮았는데, 이는 자세 불확실성 증가의 영향일 가능성이 높아, 연속적 파라미터화의 장점을 강조한다.
- 최소한의 도메인 랜덤라이제이션으로도 시뮬레이션에서 학습된 정책이 실제 로봇으로 직접 전이되었으며, 이는 강력한 강건성과 일반화 능력을 나타낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.