Skip to main content
QUICK REVIEW

[論文レビュー] Jelly Bean World: A Testbed for Never-Ending Learning

Emmanouil Antonios Platanios, Abulhair Saparov|ArXiv.org|Feb 15, 2020
Reinforcement Learning in Robotics参考文献 14被引用数 7
ひとこと要約

本論文は、強化学習における継続的学習(never-ending learning)のための、高configurableで制御可能かつ高性能なテストベッド、Jelly Bean World(JBW)を紹介する。複雑で非定常な環境を実現し、マルチタスク、マルチモーダル、カリキュラム学習の設定をサポートすることで、このような動的環境において一般知能が高パフォーマンスを発揮するために不可欠であることを示している。標準的な強化学習エージェントは、深刻な忘却と適応性の欠如により、こうした環境で失敗する。

ABSTRACT

Machine learning has shown growing success in recent years. However, current machine learning systems are highly specialized, trained for particular problems or domains, and typically on a single narrow dataset. Human learning, on the other hand, is highly general and adaptable. Never-ending learning is a machine learning paradigm that aims to bridge this gap, with the goal of encouraging researchers to design machine learning systems that can learn to perform a wider variety of inter-related tasks in more complex environments. To date, there is no environment or testbed to facilitate the development and evaluation of never-ending learning systems. To this end, we propose the Jelly Bean World testbed. The Jelly Bean World allows experimentation over two-dimensional grid worlds which are filled with items and in which agents can navigate. This testbed provides environments that are sufficiently complex and where more generally intelligent algorithms ought to perform better than current state-of-the-art reinforcement learning approaches. It does so by producing non-stationary environments and facilitating experimentation with multi-task, multi-agent, multi-modal, and curriculum learning settings. We hope that this new freely-available software will prompt new research and interest in the development and evaluation of never-ending learning systems and more broadly, general intelligence systems.

研究の動機と目的

  • 強化学習における継続的学習システムを評価するための標準的で制御可能な環境の不足に対処すること。
  • 一般化能力と継続的適応能力を試すために、複雑で動的かつ相互関連する学習タスクをサポートするテストベッドを設計すること。
  • マルチエージェント、マルチモーダルなセンシング(視覚と臭覚)、カリキュラム学習、非定常な報酬関数を実験可能にすること。
  • 特定タスクに特化した性能を超えて一般知能を評価するための再現可能で高性能なフレームワークを提供すること。
  • スケーラブルで拡張可能な環境を提供することで、生涯にわたる、蓄積的で自己向上型の学習システムに関する研究を促進すること。

提案手法

  • 多様なアイテムタイプ(例:ジェリービーン、タマネギ、壁)とエージェントのナビゲーションメカニクスを備えた2次元グリッドワールド環境を定義する。
  • 時間的に変化する報酬関数、アイテムの出現レート、環境の変化を通じて非定常なダイナミクスを実装する。
  • 視覚(視野制限あり)と臭覚(方向性、非視覚的、非インタラクティブ)の複数の知覚モダリティをサポートする。
  • 段階的な報酬関数を用いたカリキュラム学習を導入し、時間経過とともに変化させる(例:最初にタマネギを避ける、次にジェリービーンを集める)。
  • コルモゴロフ複雑度に基づく形式的な複雑度測定を用いて、環境の難易度を定義し、特化型学習と一般学習の違いを明確にする。
  • 環境とエージェントのパフォーマンスを保存・読み込み・配布・可視化するためのツールを提供する。

実験結果

リサーチクエスチョン

  • RQ1報酬関数が時間経過とともに変化する非定常的でマルチタスクな環境において、強化学習エージェントが効果的に学習できるか?
  • RQ2視覚と臭覚のマルチモーダル知覚は、複雑で遮蔽のある環境において、学習パフォーマンスと耐障害性にどのように影響を与えるか?
  • RQ3カリキュラム学習は、動的で相互関連するタスクにおいて、学習効率と最終的なパフォーマンスをどの程度向上させるか?
  • RQ4カリキュラム学習で訓練されたエージェントは、非カリキュラム学習と比較して、新しい未確認のタスク設定への一般化能力をより高められるか?
  • RQ5コルモゴロフ複雑度で測定される環境の複雑度と、一般学習能力の必要性との間に相関関係があるか?

主な発見

  • カリキュラム学習で訓練されたエージェントは、非カリキュラムベースラインと比較して顕著に高い報酬率(最大0.025 pts/s)を達成したのに対し、ベースラインは約0.005 pts/sでパフォーマンスが頭打ちとなった。
  • 視覚のみのエージェントは遮蔽環境で困難を示し、報酬率はわずか0.015 pts/sにとどまったが、一部の設定では臭覚ベースのエージェントが優れた性能を示した。
  • 視覚と臭覚の組み合わせは、遮蔽のない環境で0.03 pts/sの報酬率を達成し、マルチモーダル知覚の相乗効果を示した。
  • 報酬関数が変化する非定常環境において、カリキュラムスケジュールを用いたエージェントはより効果的に適応し、パフォーマンスの頭打ちを回避した。
  • 本テストベッドは、タスク優先順位が変化した際に標準的な強化学習エージェントに深刻な忘却を引き起こし、一般学習メカニズムの必要性を浮き彫りにした。
  • グリーディな視覚エージェントは単純な設定では有効であったが、遮蔽や回避タスクでは完全に失敗し、狭義の知覚と反応的方策の限界を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。