Skip to main content
QUICK REVIEW

[論文レビュー] Intrinsically Motivated Acquisition of Modular Slow Features for Humanoids in Continuous and Non-Stationary Environments

Varun Raj Kompella, Laurenz Wiskott|arXiv (Cornell University)|Jan 17, 2017
Reinforcement Learning in Robotics参考文献 34被引用数 3
ひとこと要約

本稿では、連続的で非定常な環境において、高次元の視覚入力からモジュール型でゆっくり変化する特徴を人間型ロボットが自律的になし得る、内発的動機付けのオンライン学習システムであるCD-MISFA 2.0を提案する。人工の好奇心と段階的遅延特徴分析を組み合わせることで、次に学習しやすいセンサー入力を動的に選択し、適応的抽象化ゲーティングによって学習を安定化させ、事前のラベル付けや離散的状態空間を必要とせずに、複数のタスクに依存しない抽象化を一連に取得することが可能になる。

ABSTRACT

A compact information-rich representation of the environment, also called a feature abstraction, can simplify a robot's task of mapping its raw sensory inputs to useful action sequences. However, in environments that are non-stationary and only partially observable, a single abstraction is probably not sufficient to encode most variations. Therefore, learning multiple sets of spatially or temporally local, modular abstractions of the inputs would be beneficial. How can a robot learn these local abstractions without a teacher? More specifically, how can it decide from where and when to start learning a new abstraction? A recently proposed algorithm called Curious Dr. MISFA addresses this problem. The algorithm is based on two underlying learning principles called artificial curiosity and slowness. The former is used to make the robot self-motivated to explore by rewarding itself whenever it makes progress learning an abstraction; the later is used to update the abstraction by extracting slowly varying components from raw sensory inputs. Curious Dr. MISFA's application is, however, limited to discrete domains constrained by a pre-defined state space and has design limitations that make it unstable in certain situations. This paper presents a significant improvement that is applicable to continuous environments, is computationally less expensive, simpler to use with fewer hyper parameters, and stable in certain non-stationary environments. We demonstrate the efficacy and stability of our method in a vision-based robot simulator.

研究の動機と目的

  • 連続的で非定常的かつ部分的に観測可能な環境において、複数の空間的または時間的に局所化された、タスクに依存しない特徴の抽象化を学習する課題に対処すること。
  • 以前の手法(例:Curious Dr. MISFA 1.0)の限界を克服すること。これらの手法は離散的状態空間を必要とし、動的な状況下で不安定になる傾向がある。
  • 外部報酬なしに、報酬を与えることなく、次に学びやすい規則性を発見するように、内発的好奇心を用いた自己動機付けの探索を可能にすること。
  • 生の画像ストリームからオンラインで抽象化を学習できる、計算効率が高く、安定的でハイパーパrameterが少ないシステムを開発すること。

提案手法

  • エージェントは、高次元のセンサー入力から新しいゆっくり変化する特徴を学習する進捗を報酬として与えることで、人工的好奇心を用いて自己動機付けの探索を実現する。
  • 時間的抽象化を抽出するために、段階的遅延特徴分析(IncSFA)を適用し、元の入力よりもゆっくり変化する原因を捉える。これは、潜在的な原因が生の入力よりもゆっくり変化するという原則に基づく。
  • 抽象化の出力の変化率をモニタリングすることで、すでに習得済みの抽象化の再学習を防ぐゲーティング機構を導入。変化率がしきい値未満に下がると、抽象化は凍結される。
  • 学習進捗が高く、かつ以前に抽象化されていないセンサーストリームを優先する、好奇心に基づいた探索ポリシーに従い、次に探索するストリームを動的に選択する。
  • 複数の高次元の観測ストリームを生成するために、連続的アクション空間(例:ヘッドの回転)を用い、異なる視覚的アングルにアクセスする。
  • ハイパーパrameterを最小限に抑える:調整対象はν、τ、σ、δの4つに限定され、事前に定義されたメタクラスや離散的ラベルを必要としない。実験間で安定した性能を示す。

実験結果

リサーチクエスチョン

  • RQ1生の視覚入力から、外部の監視なし、事前に定義された状態なしに、連続的で非定常な環境で複数のモジュール型でタスクに依存しない特徴の抽象化を自律的に発見できるか?
  • RQ2内発的好奇心と段階的遅延特徴分析を効果的に組み合わせることで、動的センサーストリームにおける一連の安定的で順次的な抽象化の学習をどのように促進できるか?
  • RQ3センサーストリームがi.i.d.でなく、部分的に観測可能で、時間的に変化する環境要因に影響を受ける状況下で、信頼性の高い抽象化の発見を可能にするメカニズムは何か?
  • RQ4重複するか競合するセンサーストリームから複数の抽象化を学習する際、冗長な学習を回避し、安定性を維持するにはどの程度の能力が必要か?

主な発見

  • アルゴリズムは2つの明確に異なる抽象化を成功裏に学習した:1つはオブジェクト1のy座標(0.4と0.6の2つの安定した位置)を符号化し、もう1つはオブジェクト3のゆっくり変化するy座標を符号化するもので、両者とも128x48のグレースケール画像から得た生の入力から抽出された。
  • 10回の実験すべてで最適ポリシーに収束し、学習難易度指標が示す通り、最初に簡単な抽象化(オブジェクト1)を学習し、その後により複雑な抽象化(オブジェクト3)を学習した。
  • 最初の抽象化φ₁は、オブジェクト1の2位置状態を信頼性高く符号化しており、最後の200回分の出力に多項式フィットを適用した結果、実際のy座標とよく一致した。
  • 2番目の抽象化φ₂も同様に、オブジェクト3のゆっくり変化するy座標を捉えており、複雑な視覚的ダイナミクスから意味のある低次元表現を抽出できる能力を示した。
  • x₂ストリーム(一様にランダムなダイナミクス)は学習を試みなかったことが確認され、アルゴリズムが学習不能な入力を正しく識別し、無駄な探索を回避していることが裏付けられた。
  • 適応的抽象化ゲーティング機構により、すでに習得済みの特徴の再学習が効果的に防止された。これは、|ḋη|がδ未満に低下し、その後探索ポリシーがリセットされたことで裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。