Skip to main content
QUICK REVIEW

[論文レビュー] Interpretable Reinforcement Learning with Ensemble Methods

Alexander Brown, Marek Petrik|arXiv (Cornell University)|Sep 19, 2018
Reinforcement Learning in Robotics参考文献 13被引用数 3
ひとこと要約

本稿では、強化学習のための解釈可能な方策を生成するために勾配ブースティング回帰木を用いる手法を提案する。深層ニューラルネットワークやSARSAエージェントからの方策データを用いてアンサンブルを訓練する。この手法は、Cart-Pole や Mountain Car といったシンプルな環境において、元のエージェントと同等またはそれ以上の性能を達成しており、解釈可能なモデルが高パフォーマンスな強化学習システムと同等の性能を発揮しつつも、人間が理解可能な形を保つことを示している。

ABSTRACT

We propose to use boosted regression trees as a way to compute human-interpretable solutions to reinforcement learning problems. Boosting combines several regression trees to improve their accuracy without significantly reducing their inherent interpretability. Prior work has focused independently on reinforcement learning and on interpretable machine learning, but there has been little progress in interpretable reinforcement learning. Our experimental results show that boosted regression trees compute solutions that are both interpretable and match the quality of leading reinforcement learning methods.

研究の動機と目的

  • 医療や金融などハイリスク分野において、解釈可能なソリューションの不足に取り組むこと。
  • アンサンブル手法、特に勾配ブースティング木を用いることで、正確かつ解釈可能な方策を生成できるかどうかを調査すること。
  • 2つのアプローチを評価すること:(1) 事前に訓練されたエージェントからの方策データを用いた教師あり学習、および (2) からスクラッチで決定木を用いた方策勾配ブースティング。
  • 木のアンサンブルが過学習を抑え、元の強化学習エージェントよりも一般化性能に優れるかどうかを調査すること。
  • 空間効率の良い木の再利用が、モデルサイズを制限しつつ性能を維持できるかどうかを評価すること。

提案手法

  • 強化学習環境において、事前に訓練された深層ニューラルネットワーク方策の挙動を模倣するように、小さな回帰木の勾配ブースティングアンサンブルを訓練する。
  • 訓練済みの強化学習エージェント(例:ニューラルネットワークやSARSA)から収集した状態-行動ペアを用いて、教師あり学習により勾配ブースティングでアンサンブルを訓練する。
  • 各木を方策パラメータとみなして、期待報酬の勾配上昇に基づき、決定木に直接方策勾配降下法を適用する。
  • 古い木を再利用することで木の再利用を実装し、削除予定の木の残差と予測値に基づいて新しい木を訓練する。
  • 方策勾配更新の分散を低減するために、価値関数近似を用いる。これはアクター・クリティック手法に類似している。
  • 解釈可能性を保つために木の深さとアンサンブルのサイズを制限し、ノード数や木の深さを指標として解釈可能性を測定する。

実験結果

リサーチクエスチョン

  • RQ1勾配ブースティング木のアンサンブルは、標準的な強化学習ベンチマークにおいて、深層ニューラルネットワーク方策と同等の性能を達成できるか?
  • RQ2アンサンブル手法は、元のニューラルネットワーク方策と比較して一般化性能が向上し、過学習を抑えられるか?
  • RQ3決定木を用いた方策勾配ブースティングは、シンプルなMDPにおいて、からスクラッチで段階的に有効な方策を学習できるか?
  • RQ4アンサンブル内の木の再利用は、性能を著しく低下させることなくモデルサイズを削減できるか?
  • RQ5得られた方策は人間がどの程度解釈可能か。また、性能と解釈可能性のトレードオフはどの程度か?

主な発見

  • Cart-Pole環境では、ニューラルネットワーク方策データに基づくアンサンブルが、1エピソードあたり200ステップの完全な性能を達成し、元のニューラルネットワークを上回った。これは過学習の兆候が見られたのとは対照的であった。
  • Mountain Car環境では、アンサンブルはSARSAエージェントと同等のエピソード報酬を達成したが、それを超えることはできなかった。
  • 決定木を用いた方策勾配ブースティングは、時間経過とともに累積報酬を増加させることができ、Cart-Poleでは1エピソードあたり最大200に近づいたが、ニューラルネットワークに比べてはるかに遅い速度で進行した。
  • 方策勾配ブースティングによる学習プロセスは、最適性能に到達するまでに8,000~10,000エピソードを要したのに対し、ニューラルネットワークは約400エピソードで到達した。
  • 木の再利用は性能を著しく低下させた。エピソード4,000で再利用を開始した後、性能は低下し、その後回復しなかった。これは、高い報酬を維持するための戦略としての再利用は現実的でないことを示している。
  • アンサンブル手法は小さな木を用いることで解釈可能性を保ち、得られたモデルは人間が読み解ける形であり、木構造を通じて決定ルールを追跡可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。