Skip to main content
QUICK REVIEW

[論文レビュー] Task-Agnostic Morphology Evolution

Donald J. Hejna, Pieter Abbeel|arXiv (Cornell University)|Feb 25, 2021
Reinforcement Learning in Robotics参考文献 37被引用数 5
ひとこと要約

本稿では、報酬信号やポリシー学習を必要とせず、ランダムに抽出された行動プリミティブと情報理論的適応度目的関数(状態の多様性と行動の予測可能性を測定)を用いて、ロボットの形状を進化させる非教師付き手法である、タスクに依存しない形状進化(TAME)を提案する。TAMEは、2次元・3次元・操作環境において、報酬信号やポリシー学習を一切必要とせず、迅速かつ汎用的な形状設計が可能であり、タスク特化型手法と同等のマルチタスク性能を達成する。

ABSTRACT

Deep reinforcement learning primarily focuses on learning behavior, usually overlooking the fact that an agent's function is largely determined by form. So, how should one go about finding a morphology fit for solving tasks in a given environment? Current approaches that co-adapt morphology and behavior use a specific task's reward as a signal for morphology optimization. However, this often requires expensive policy optimization and results in task-dependent morphologies that are not built to generalize. In this work, we propose a new approach, Task-Agnostic Morphology Evolution (TAME), to alleviate both of these issues. Without any task or reward specification, TAME evolves morphologies by only applying randomly sampled action primitives on a population of agents. This is accomplished using an information-theoretic objective that efficiently ranks agents by their ability to reach diverse states in the environment and the causality of their actions. Finally, we empirically demonstrate that across 2D, 3D, and manipulation environments TAME can evolve morphologies that match the multi-task performance of those learned with task supervised algorithms. Our code and videos can be found at https://sites.google.com/view/task-agnostic-evolution.

研究の動機と目的

  • 現在の形状最適化手法がタスク特化型報酬やポリシー学習に依存するという限界を解消すること。これにより、狭く一般化できない形状が生じる。
  • 明示的なタスク監視や行動学習を経ずに、複数のタスクで良好に動作する形状を進化させること。
  • タスク報酬に依存せず、内発的探索能力と制御能力に基づいて形状の質を評価する適応度関数を設計すること。
  • 高価なポリシー最適化の代わりにランダム行動サンプリングと情報理論的ランク付けを用いることで、高速かつスケーラブルな形状進化を可能にすること。
  • タスクに依存しない形状進化が、多様な環境においてタスク特化型手法と同等のマルチタスク性能を達成できることを実証すること。

提案手法

  • TAMEは、形状が到達可能な多様な状態の数と、行動が状態遷移にどれほど予測可能に寄与するかを定量化する情報理論的適応度目的関数を用いる。
  • 適応度関数は、行動を入力とした状態の条件付き分布をモデル化するためのニューラルネットワーク $ q_\phi $ を用いた変分推論フレームワークで推定される。
  • 定期的に $ q_\phi $ をリセットすることで、古い形状に過剰適合しないように正則化された進化的アルゴリズムにより形状が進化する。
  • 集団内の各エージェントは、その形状に対してランダムに抽出された行動プリミティブを実行し、状態遷移データを収集することで評価される。
  • 行動プリミティブは関節ごとに定義され、環境の特性に応じて選択可能であり、操作タスクでは正弦波信号、歩行タスクでは一定トルクが使用可能である。
  • グラフニューラルネットワーク(GNNs)を用いて形状構造を符号化し、任意の数の肢を持つ形状のエンドツーエンド進化を可能にする。

実験結果

リサーチクエスチョン

  • RQ1タスク特化型報酬やポリシー学習なしに、形状を効果的に最適化できるか?
  • RQ2形状の内発的探索能力と環境制御能力を測るためのタスクに依存しない適応度関数をどのように設計できるか?
  • RQ3教師あり行動学習と比較して、ランダム行動プリミティブが形状進化に十分な信号を提供できるか?
  • RQ4行動プリミティブの選択が、異なる環境における進化形状の性能にどのように影響するか?
  • RQ5TAMEは、複数のタスクに一般化可能な形状を進化させられ、タスク特化型手法と同等の性能を達成できるか?

主な発見

  • TAMEが進化させた形状は、2次元歩行、3次元歩行、操作環境において、タスク特化型アルゴリズムで学習された形状と同等のマルチタスク性能を達成した。
  • 2次元歩行環境では、コサイン関数を用いた行動プリミティブで平均報酬 $ 700.4 \pm 42.8 $ を達成し、一定値プリミティブ($ 610.4 \pm 76.6 $)を上回り、教師ありベースラインと同等の性能を示した。
  • 3次元歩行環境では、コサインプリミティブで $ 533.5 \pm 38.7 $ を達成し、一定プリミティブ($ 412.0 \pm 36.8 $)を顕著に上回り、教師あり性能と同等だった。
  • アブレーションスタディの結果、各関節に多様な行動プリミティブを用いることが不可欠であることが判明。すべての関節で同じプリミティブを使用すると、性能はほぼランダムレベルにまで低下した。
  • $ q_\phi $ の周期的リセットを削除すると、適応度信号の質が低下し、進化性能も悪化した。正則化係数 $ \lambda = 1 $ に設定した場合、適応度は高かったが制御性が著しく低下し、制御不能な形状が得られた。
  • TAMEは、非進化的ベースライン(TAMR)をすべてのタスクで上回り、進化的探索が高品質な形状を発見するために不可欠であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。