Skip to main content
QUICK REVIEW

[논문 리뷰] DMAP: a Distributed Morphological Attention Policy for Learning to Locomote with a Changing Body

Alberto Silvio Chiappa, Alessandro Marin Vargas|arXiv (Cornell University)|2022. 09. 28.
Action Observation and Synchronization인용 수 8
한 줄 요약

DMAP는 체형 매개변수에 대한 명시적 접근 없이도 다양한 신체 구조를 가진 에이전트가 운동을 학습할 수 있도록 하는 생물학적으로 영감을 받은 주의 기반 딥 강화 학습 아키텍처를 제안한다. 분산 관절 제어, 독립적 운동감각 처리, 동적 주의 게이팅을 조합함으로써 DMAP는 네 가지 연속 제어 환경 전반에서 원천 에이전트(모든 체형 지식을 가진 에이전트)의 성능을 도달하거나 초월하는 성능을 달성한다.

ABSTRACT

Biological and artificial agents need to deal with constant changes in the real world. We study this problem in four classical continuous control environments, augmented with morphological perturbations. Learning to locomote when the length and the thickness of different body parts vary is challenging, as the control policy is required to adapt to the morphology to successfully balance and advance the agent. We show that a control policy based on the proprioceptive state performs poorly with highly variable body configurations, while an (oracle) agent with access to a learned encoding of the perturbation performs significantly better. We introduce DMAP, a biologically-inspired, attention-based policy network architecture. DMAP combines independent proprioceptive processing, a distributed policy with individual controllers for each joint, and an attention mechanism, to dynamically gate sensory information from different body parts to different controllers. Despite not having access to the (hidden) morphology information, DMAP can be trained end-to-end in all the considered environments, overall matching or surpassing the performance of an oracle agent. Thus DMAP, implementing principles from biological motor control, provides a strong inductive bias for learning challenging sensorimotor tasks. Overall, our work corroborates the power of these principles in challenging locomotion tasks.

연구 동기 및 목표

  • 신체 구조의 상당한, 예측할 수 없는 변화가 발생하더라도 운동을 안정적으로 학습할 수 있는 강화 학습 정책을 개발하는 것.
  • 생물학적으로 영감을 받은 원칙—분산 제어, 독립적 감각 처리, 동적 게이팅—이 운동 감각 적응에 강력한 인덕티브 바이어스를 제공하는지 조사하는 것.
  • 종료형으로 학습 가능한 정책이 숨겨진 체형 매개변수에 접근할 수 있는 원천 에이전트의 성능을 도달하거나 초월할 수 있는지 평가하는 것.
  • 주의 메커니즘의 동역학과 체형 변화 간의 일반화에 미치는 역할을 분석하는 것.

제안 방법

  • DMAP는 각 신체 부위에 대해 독립적으로 운동감각 상태 역사 정보를 처리하기 위해 공유 가중치를 가진 시간적 컬러션 네트워크(TCN)를 사용한다.
  • 관절별 체형 인코딩은 감각 입력에서 유도된 값 인코딩 벡터에 대해 학습된 주의 가중치를 적용하여 계산된다.
  • 각 관절은 현재 운동감각과 그 관절별 체형 인코딩을 모두 사용하는 독립적인 완전 연결 네트워크에 의해 제어된다.
  • 주의 메커니즘은 작업에 관련된 체형에 따라 다른 신체 부위의 감각 정보를 서로 다른 제어기로 게이팅한다.
  • 전체 아키텍처는 체형 매개변수에 대한 지도 없이, 희소이고 밀도 높은 보상 이외의 정보에 의존하여 종료형으로 훈련된다.
  • 제로샷 일반화를 테스트하기 위해 DMAP는 분포 내(IID) 및 분포 외(OOD) 체형 변화에 대해 평가된다.

실험 결과

연구 질문

  • RQ1각 에피소드 시작 시 랜덤하게 변화된 체형을 가진 에이전트가 강화 학습 정책을 통해 효과적으로 운동을 학습할 수 있는가?
  • RQ2생물학적 운동 제어 원칙—분산 제어, 독립적 처리, 동적 게이팅—을 통합함으로써 예측할 수 없는 체형에 대한 일반화 성능이 향상되는가?
  • RQ3종료형으로 학습된 에이전트가 숨겨진 체형 매개변수에 접근할 수 있는 원천 에이전트의 성능을 도달하거나 초월할 수 있는가?
  • RQ4DMAP의 주의 메커니즘이 체형 변화에 어떻게 적응하는가? 그리고 훈련 과정에서 어떤 동역학이 발생하는가?

주요 결과

  • DMAP는 체형 매개변수에 접근하지 못함에도 불구하고 네 가지 환경(Ant, Half Cheetah, Walker, Hopper) 전반에서 원천 에이전트와 동등하거나 뛰어난 성능을 달성한다.
  • 단순 기준선(baseline)은 운동감각 정보만을 기반으로 하여 다양한 체형에서 효과적인 운동 전략을 학습하지 못한다.
  • DMAP는 분포 외 체형 변화, 특히 사지 절단(100% 변화)에 대해 강건하게 일반화되며, 보상은 단조롭게 감소하지만 다양한 사지 유형에서 안정성을 유지한다.
  • 주의 메커니즘은 임베딩 공간에서 회전 동역학을 보이며, 훈련 과정에서 점진적으로 나타나고, 정돈되고 규제된 궤적을 기여한다.
  • 관찰 및 행동 공간 궤적에 비해 주의 동역학은 훨씬 덜 엉킨 편이며, 이는 향상된 일반화와 강건성의 가능성을 시사한다.
  • DMAP와 RMA 간의 새로운 체형에 대한 적응 속도는 유사하여, DMAP가 이중 단계 훈련 절차 없이도 빠른 적응을 달성함을 의미한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.