Skip to main content
QUICK REVIEW

[논문 리뷰] Task-Agnostic Morphology Evolution

Donald J. Hejna, Pieter Abbeel|arXiv (Cornell University)|2021. 02. 25.
Reinforcement Learning in Robotics참고 문헌 37인용 수 5
한 줄 요약

이 논문은 임의로 샘플된 동작 프리미티브와 정보 이론적 적합도 목적함수를 사용하여 랜덤으로 선택된 동작 프리미티브와 상태 다양성 및 동작 예측 가능성 측정을 기반으로 한 비지도 방법인 작업 독립형 형태학 진화(TAME)를 제안한다. TAME는 보상 신호나 정책 학습이 필요 없이 2차원, 3차원 및 조작 환경에서 빠르고 일반화 가능한 형태학 설계를 가능하게 하여 작업 지도 학습 방법과 유사한 다중 작업 성능을 달성한다.

ABSTRACT

Deep reinforcement learning primarily focuses on learning behavior, usually overlooking the fact that an agent's function is largely determined by form. So, how should one go about finding a morphology fit for solving tasks in a given environment? Current approaches that co-adapt morphology and behavior use a specific task's reward as a signal for morphology optimization. However, this often requires expensive policy optimization and results in task-dependent morphologies that are not built to generalize. In this work, we propose a new approach, Task-Agnostic Morphology Evolution (TAME), to alleviate both of these issues. Without any task or reward specification, TAME evolves morphologies by only applying randomly sampled action primitives on a population of agents. This is accomplished using an information-theoretic objective that efficiently ranks agents by their ability to reach diverse states in the environment and the causality of their actions. Finally, we empirically demonstrate that across 2D, 3D, and manipulation environments TAME can evolve morphologies that match the multi-task performance of those learned with task supervised algorithms. Our code and videos can be found at https://sites.google.com/view/task-agnostic-evolution.

연구 동기 및 목표

  • 현재 형태학 최적화 방법이 작업에 특화된 보상과 정책 학습에 의존함으로써 좁고 일반화되지 않는 형태학을 초래하는 한계를 해결하기 위해.
  • 명시적인 작업 감독이나 행동 학습 없이도 여러 작업에서 잘 수행할 수 있는 형태학을 진화시키는 방법을 개발하기 위해.
  • 작업 보상에 종속되지 않고 형태학의 내재된 탐색 및 제어 능력에 기반해 형태학의 품질을 평가하는 적합도 함수를 설계하기 위해.
  • 비용이 많이 드는 정책 최적화를 랜덤 동작 샘플링과 정보 이론적 순위 매기기로 대체하여 빠르고 확장 가능한 형태학 진화를 가능하게 하기 위해.
  • 작업에 종속되지 않는 형태학 진화가 다양한 환경에서 작업 지도 학습 방법의 다중 작업 성능을 따라잡을 수 있는지 확인하기 위해.

제안 방법

  • TAME는 형태학이 도달할 수 있는 다양한 상태의 수와 동작가 상태 전이에 얼마나 예측 가능하게 이르는지를 수량화하는 정보 이론적 적합도 목적함수를 사용한다.
  • 적합도 함수는 신경망 $ q_\phi $ 를 사용한 변동형 추론 프레임워크를 통해 추정되며, 이는 동작에 조건부로 된 상태 분포를 모델링한다.
  • 형태학은 정규화된 진화 알고리즘을 통해 진화되며, 이는 $ q_\phi $ 를 주기적으로 재설정하여 이전 형태학에 과적합되는 것을 방지한다.
  • 각 개체군 내의 에이전트는 자신의 형태학에 대해 랜덤으로 샘플된 동작 프리미티브를 실행하고 상태 전이 데이터를 수집함으로써 평가된다.
  • 동작 프리미티브는 관절별로 정의되며, 환경 특성에 따라 선택될 수 있다. 예를 들어 조작 작업에는 사인 신호를, 이동 작업에는 일정 토크를 사용할 수 있다.
  • 그래프 신경망(GNNs)은 형태학의 구조를 인코딩하고 임의의 수의 지느러미를 가진 형태학의 엔드 투 엔드 진화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1특정 작업에 대한 보상이나 정책 학습 없이도 형태학을 효과적으로 최적화할 수 있는가?
  • RQ2형태학의 내재된 환경 탐색 및 제어 능력을 측정할 수 있는 작업 독립형 적합도 함수를 어떻게 설계할 수 있는가?
  • RQ3감독된 행동 학습에 비해 랜덤 동작 프리미티브가 형태학 진화에 충분한 신호를 제공할 수 있는가?
  • RQ4동작 프리미티브의 선택이 다양한 환경에서 진화된 형태학의 성능에 어떤 영향을 미치는가?
  • RQ5TAME는 여러 작업에 일반화되는 형태학을 진화시킬 수 있으며, 이는 작업 지도 학습 방법의 성능을 따라잡을 수 있는가?

주요 결과

  • TAME가 진화시킨 형태학은 2차원 이동, 3차원 이동 및 조작 환경에서 작업 지도 학습 알고리즘으로 학습된 형태학과 유사한 다중 작업 성능을 달성했다.
  • 2차원 이동 환경에서 TAME는 코사인 동작 프리미티브를 사용해 평균 수익 $ 700.4 \pm 42.8 $ 를 달성했으며, 일정 동작 프리미티브($ 610.4 \pm 76.6 $)를 초월했고, 감독 기반 기준선과 유사한 성능을 보였다.
  • 3차원 이동 환경에서 TAME는 코사인 프리미티브를 사용해 $ 533.5 \pm 38.7 $ 를 기록했으며, 일정 프리미티브($ 412.0 \pm 36.8 $)를 크게 앞서며 감독 기반 성능과 유사했다.
  • 절단 실험 결과, 각 관절에 다양한 동작 프리미티브를 사용하는 것이 핵심임을 확인했으며, 모든 관절에 동일한 프리미티브를 사용할 경우 성능이 거의 무작위 수준으로 악화되었다.
  • $ q_\phi $ 의 주기적 리셋을 제거하면 적합도 신호 품질이 떨어져 진화 성능이 저하되었으며, 정규화 계수 $ \lambda = 1 $ 으로 설정할 경우 높은 적합도를 보였지만 제어성이 낮은 형태학이 유도되었다.
  • TAME는 모든 작업에서 비진화 기반 모델인 TAMR를 능가했으며, 이는 진화적 탐색이 고품질 형태학을 발견하는 데 필수적임을 확인시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.