Skip to main content
QUICK REVIEW

[論文レビュー] Neural-encoding Human Experts' Domain Knowledge to Warm Start Reinforcement Learning

Andrew Silva, Matthew Gombolay|arXiv (Cornell University)|Feb 15, 2019
Reinforcement Learning in Robotics参考文献 41被引用数 8
ひとこと要約

この論文では、意思決定ツリーを用いて人間のドメイン知識を命題論理規則として符号化することで、強化学習エージェントを知的に初期化する、新しいニューラルネットワークアーキテクチャであるProLoNetsを提案する。ネットワークの重みと構造に直接専門知識を埋め込むことで、ProLoNetsはベースラインと比較して初期段階での期待報酬が80%以上高く、学習後には60%以上の向上を達成した。非専門家の入力でも同様の効果が得られる。

ABSTRACT

Deep reinforcement learning has been successful in a variety of tasks, such as game playing and robotic manipulation. However, attempting to learn extit{tabula rasa} disregards the logical structure of many domains as well as the wealth of readily available knowledge from domain experts that could help "warm start" the learning process. We present a novel reinforcement learning technique that allows for intelligent initialization of a neural network weights and architecture. Our approach permits the encoding domain knowledge directly into a neural decision tree, and improves upon that knowledge with policy gradient updates. We empirically validate our approach on two OpenAI Gym tasks and two modified StarCraft 2 tasks, showing that our novel architecture outperforms multilayer-perceptron and recurrent architectures. Our knowledge-based framework finds superior policies compared to imitation learning-based and prior knowledge-based approaches. Importantly, we demonstrate that our approach can be used by untrained humans to initially provide >80% increase in expected reward relative to baselines prior to training (p < 0.001), which results in a >60% increase in expected reward after policy optimization (p = 0.011).

研究の動機と目的

  • 複雑なドメインにおけるタブラ・ラサの深層強化学習の非効率性を、容易に入手可能な人間の専門知識を活用することで解決すること。
  • 大規模なラベル付きデータセットや手作業によるラベル付けを必要とするアノテーション学習の限界を克服すること。
  • 非専門家が効果的なポリシー仕様を提供でき、初期学習性能を著しく向上させることを可能にすること。
  • 初期の知識に基づいた初期化を超えて、表現力が時間経過とともに向上するトレーニング可能なニューラルアーキテクチャを開発すること。
  • 巨大な計算リソース、専門家データ、または複雑なハンドエーキュレーションに依存しない強化学習の民主化を図ること。

提案手法

  • 意思決定ツリーから人間が指定した命題論理規則を直接ネットワークの重みと構造に符号化するニューラルネットワークアーキテクチャ、ProLoNetsを提案する。
  • 意思決定ツリーを、ドメインエキスパートや非専門家がif-then形式の状態-行動規則で高レベルのポリシーを定義できるユーザーフレンドリーなインターフェースとして活用する。
  • 意思決定ツリーから直接ネットワークの構造とパラメータを初期化し、論理的構造をネットワークの接続性と重みに埋め込む。
  • ポリシーグラデント更新を適用して初期化されたポリシーを最適化し、エージェントが初期の専門家仕様を超えて改善できるようにする。
  • ProLoNetsに動的成長を導入し、学習中にネットワークの容量と表現力を拡張可能にすることで、元の知識を上回る性能を達成可能にする。
  • ドメイン固有の構造的・論理的制約を活用して、無作為な探索を減らし、複雑な環境での収束を加速する。

実験結果

リサーチクエスチョン

  • RQ1意思決定ツリーとして提供された人間のドメイン知識は、大規模なラベル付きデータセットを必要とせずに、強化学習の初期性能を著しく向上させることができるか?
  • RQ2専門知識をニューラルネットワークのアーキテクチャと重みに直接埋め込むことで、アノテーション学習や標準的な深層強化学習ベースラインを凌駆する性能が得られるか?
  • RQ3非専門家が提供する有用なポリシー仕様は、ランダム初期化と比較して優れた学習結果をもたらすか?
  • RQ4ポリシーグラデント最適化を通じて、初期の知識に基づいた初期化を超えて表現力がどの程度向上できるか?
  • RQ5提案手法により、収束が速く、サンプル効率が良いことで、深層強化学習の計算負荷を低減できるか?

主な発見

  • 非専門家が提供したポリシー仕様により、学習前の段階でベースラインと比較して期待報酬が80%以上向上した(p < 0.001)。
  • ポリシー最適化後、ProLoNetエージェントはベースラインと比較して期待報酬が60%以上向上した(p = 0.011)、初期知識の有効な最適化を示した。
  • StarCraft IIミニゲームの変更版では、ProLoNetsは最良のベースライン(アノテーション学習および知識ベース手法を含む)と比較して平均報酬が100%以上も上回った。
  • Lunar Lander環境では、ProLoNetsの動的成長により、初期ポリシーの2倍の平均報酬を達成し、元の専門家仕様を上回った。
  • OpenAI Gymおよび変更版StarCraft II環境を含む、すべての評価タスクにおいて、多層パーセプトロンおよび再帰的ニューラルネットワークアーキテクチャを上回った。
  • 未訓練の参加者が初期ポリシーを提供した野火シミュレーションドメインにおいて、フレームワークは頑健性と実用性を示し、ランダム初期化を著しく上回る性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。