[논문 리뷰] Learning to Walk in the Real World with Minimal Human Effort
논문은 다중 작업 학습과 안전 제약 SAC를 활용해 최소한의 인간 개입으로 여러 지형에서 걷기 정책을 학습하는 다족 보행 로봇의 자율 실세계 RL 시스템을 제시하며, Minitaur에서 효과적인 실세계 학습을 달성하고 넘어짐을 줄인다.
Reliable and stable locomotion has been one of the most fundamental challenges for legged robots. Deep reinforcement learning (deep RL) has emerged as a promising method for developing such control policies autonomously. In this paper, we develop a system for learning legged locomotion policies with deep RL in the real world with minimal human effort. The key difficulties for on-robot learning systems are automatic data collection and safety. We overcome these two challenges by developing a multi-task learning procedure and a safety-constrained RL framework. We tested our system on the task of learning to walk on three different terrains: flat ground, a soft mattress, and a doormat with crevices. Our system can automatically and efficiently learn locomotion skills on a Minitaur robot with little human intervention. The supplemental video can be found at: \url{https://youtu.be/cwyiq6dCgOc}.
연구 동기 및 목표
- 데이터 수집, 재설정, 학습 안전을 자동화하여 실세계 다족 로봇 학습에 필요한 인간 노력을 감소시키는 것.
- 단일 학습 세션 내에서 여러 보행 기술(전진, 후진, 회전)을 학습하도록 기능을 학습하는 것.
- 평지, 부드러운 매트리스, 틈이 있는 도어매트를 포함한 다양한 지형에서 견고한 학습을 시연하는 것.
- 안전 제약이 있는 RL이 실세계 데이터 수집에서 넘어짐과 학습 중단을 감소시키는 것을 보여주는 것.
제안 방법
- 로봇을 훈련 작업 공간 내에 두기 위해 보행 방향을 선택하는 작업 스케줄러가 있는 다중 작업 RL 프레임워크를 채택한다.
- 에피소드 시작에 대한 상대 방향의 원하는 모션을 인코딩하는 3차원 작업 벡터 w^i를 가진 작업별 보상을 정의한다.
- 교차 작업 간 간섭을 피하기 위해 공유된 actor/critic 없이 각 작업에 대해 독립적인 SAC 정책을 학습한다.
- 훈련 중 몸통 피치/롤을 제한하기 위해 라그랑주 승수를 사용하는 제약된 MDP로서 안전 제약을 도입한다.
- 정책과 라그랑주 승수를 공동으로 업데이트하기 위해 이중 경사 하강법으로 최적화한다.
- 작업 공간 경계에 가까운 곳에서 안전 인지 반환 계산으로 과도한 재설정을 방지하기 위해 조기 종료를 사용한다.
실험 결과
연구 질문
- RQ1다중 지형에서 최소한의 인간 개입으로 자율 실세계 RL이 다족 보행을 학습할 수 있는가?
- RQ2실세계 환경에서 여러 보행 정책을 동시에 학습하는 것이 가능한가?
- RQ3표준 방법과 비교하여 안전 제약이 있는 RL 프레임워크가 넘어짐 및 학습 중단의 수를 감소시키는가?
주요 결과
- 시스템은 평지, 부드러운 매트리스, 그리고 틈이 있는 도어매트에서 최소한의 인간 개입으로 걷는 법을 학습하며(평지 실행 중 세 번 중 두 번은 수동 재설정 없이).
- 하나의 세션에서 네 가지 보행 정책(전진, 후진, 좌회전, 우회전)을 학습할 수 있어 테스트 시점에 전체 방향 제어 보행기를 가능하게 한다.
- 평지에서 두 개의 정책(전진 및 후진)을 학습하는 데 약 1.5시간(~각 정책당 60k 스텝)이 필요했다.
- 도전적인 표면에서, 전진/후진 걷기는 5.5시간(mattress, ~200k steps) 및 4.5시간(doormat, ~150k steps) 동안 학습되었다.
- 안전 제약이 있는 SAC는 안전 제약이 없는 SAC에 비해 넘어짐을 크게 감소시켜(대략 40회 vs 기준선에서 100회 이상), 학습 중단을 줄인다.
- 멀티-task 학습은 작업 공간 크기에 관계없이 기준선의 약 5-10% 수준으로 작업 공간 외 실패를 크게 감소시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.