Skip to main content
QUICK REVIEW

[論文レビュー] Robot Representing and Reasoning with Knowledge from Reinforcement Learning.

Keting Lu, Shiqi Zhang|arXiv (Cornell University)|Sep 28, 2018
Reinforcement Learning in Robotics参考文献 21被引用数 12
ひとこと要約

本論文は、論理的確率的知識表現と推論(KRR)とモデルベース強化学習(RL)を統合するハイブリッドフレームワークを提案し、モバイルロボットが人間が提供する記述的知識とRLが抽出した経験を統合することで、タスク固有の計画モデルを動的に構築できるようにする。このアプローチは、従来のモデルベースRL手法と比較して、対話、ナビゲーション、配達タスクにおける性能を顕著に向上させる。

ABSTRACT

Reinforcement learning (RL) agents aim at learning by interacting with an environment, and are not designed for representing or reasoning with declarative knowledge. Knowledge representation and reasoning (KRR) paradigms are strong in declarative KRR tasks, but are ill-equipped to learn from such experiences. In this work, we integrate logical-probabilistic KRR with model-based RL, enabling agents to simultaneously reason with declarative knowledge and learn from interaction experiences. The knowledge from humans and RL is unified and used for dynamically computing task-specific planning models under potentially new environments. Experiments were conducted using a mobile robot working on dialog, navigation, and delivery tasks. Results show significant improvements, in comparison to existing model-based RL methods.

研究の動機と目的

  • 強化学習エージェントが記述的知識を表現・推論する能力に制限があることに対処すること。
  • 従来のKRRシステムが相互作用経験から学習できないことの課題を克服すること。
  • 人間が提供する知識とRLが抽出した知識を統合し、動的計画モデルの生成を可能とすること。
  • 統合された知識源を用いて、新規または変化する環境において計画モデルを適応的に変更できるようにすること。
  • 対話、ナビゲーション、配達などの現実世界のロボットタスクにおけるパフォーマンス向上を図ること。

提案手法

  • 論理的確率的KRRとモデルベースRLを組み合わせ、記述的知識の表現と推論を可能とする。
  • 人間が構造化した知識を事前知識として用い、学習プロセスをガイドおよび制約する。
  • 人間の知識とRLが抽出した経験を統合することで、タスク固有の計画モデルを動的に構築する。
  • 推論と学習の両方を支援する共通のフレームワーク内で、統一された知識表現を採用する。
  • モデルベースRLを活用し、環境との相互作用を通じて計画モデルを精緻化および更新する。
  • 統一された知識ベースを再計算することで、新環境への適応を可能にする。

実験結果

リサーチクエスチョン

  • RQ1人間が提供する記述的知識を、統一されたフレームワーク内で強化学習の経験と効果的に統合する方法は何か?
  • RQ2KRRとモデルベースRLの統合は、動的環境における計画と意思決定を改善できるか?
  • RQ3統一された知識表現は、新たな環境条件下でも動的モデル生成をどのように支援するか?
  • RQ4KRRとモデルベースRLを統合することで、現実世界のロボットタスクで達成可能なパフォーマンス向上はどの程度か?
  • RQ5複雑なタスクにおいて、このフレームワークは既存のモデルベースRL手法をどの程度上回るか?

主な発見

  • 提案されたフレームワークは、従来のモデルベースRL手法と比較して、対話、ナビゲーション、配達タスクにおけるパフォーマンスを顕著に向上させる。
  • 人間が提供する知識とRLが抽出した経験の統合により、新環境におけるより強固で適応性のある計画が可能になる。
  • 統一された知識表現により、実行中にタスク固有の計画モデルを動的に再計算できる。
  • 論理的確率的KRRと経験に基づく学習を併用することで、推論能力が向上する。
  • 計画プロセスに事前知識を組み込むことで、広範な試行錯誤学習への依存が軽減される。
  • 結果として、タスク成功確率と計画効率に測定可能な向上が見られるが、提供された要約では具体的な指標は明示されていない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。