Skip to main content
QUICK REVIEW

[論文レビュー] Optimization Methods for Interpretable Differentiable Decision Trees in Reinforcement Learning

Andrew Silva, Taylor W. Killian|arXiv (Cornell University)|Mar 22, 2019
Explainable Artificial Intelligence (XAI)参考文献 47被引用数 15
ひとこと要約

本稿では、強化学習におけるオンラインで解釈可能な方策学習を可能にするために、方策勾配強化学習を用いて訓練される微分可能意思決定木(DDT)を提案する。実験では、DDTが深層ニューラルネットワークと同等またはそれ以上の性能を達成するとともに、人間が読み取り可能な意思決定方策を提供することを示しており、ユーザースタディーではバッチ学習済み木と比較して7倍の報酬が得られ、有意に高い解釈可能性(p < 0.001)を示した。

ABSTRACT

Decision trees are ubiquitous in machine learning for their ease of use and interpretability. Yet, these models are not typically employed in reinforcement learning as they cannot be updated online via stochastic gradient descent. We overcome this limitation by allowing for a gradient update over the entire tree that improves sample complexity affords interpretable policy extraction. First, we include theoretical motivation on the need for policy-gradient learning by examining the properties of gradient descent over differentiable decision trees. Second, we demonstrate that our approach equals or outperforms a neural network on all domains and can learn discrete decision trees online with average rewards up to 7x higher than a batch-trained decision tree. Third, we conduct a user study to quantify the interpretability of a decision tree, rule list, and a neural network with statistically significant results ($p &lt; 0.001$).

研究の動機と目的

  • 強化学習におけるオンラインで解釈可能な関数近似の欠如に応えるために、意思決定木の勾配ベース学習を可能にする。
  • 通常の意思決定木が微分不能であるため、確率的勾配降下法によるオンライン更新が不可能であるという課題を克服する。
  • 微分可能意思決定木が、標準的な強化学習ベンチマークで深層ニューラルネットワークと同等またはそれ以上の性能を達成できることを実証する。
  • 人間が参加する意思決定文脈において、DDT、意思決定リスト、ニューラルネットワークの解釈可能性と使いやすさを定量的に評価する。
  • 強化学習における微分可能意思決定木の学習に、Q学習ではなく方策勾配を用いる理論的動機を提示する。

提案手法

  • スイッチの決定をシグモイド関数でパラメータ化することで、木構造全体に勾配が流れ込むように設計された微分可能意思決定木(DDT)アーキテクチャを提案する。
  • バックプロパゲーションを介してエンドツーエンドのオンライン更新が可能な、方策勾配強化学習を用いてDDTを訓練する。
  • 木全体を通じた期待報酬を計算するための微分可能なソフトルーティング機構を導入し、モデル全体の勾配計算を可能にする。
  • 訓練後、解釈可能なハードルールに変換するための離散的プルーニング戦略を適用する。
  • 実際の方策とシミュレートされた意思決定タスクを用いて、DDT、意思決定リスト、ワンホットMLPの解釈性と使いやすさを比較するユーザースタディーを実施する。
  • MLPの重みをバイナリ化して、公平な比較が可能な簡略化された人間が読み取り可能なバージョンを生成する。

実験結果

リサーチクエスチョン

  • RQ1微分可能意思決定木は、方策勾配強化学習を用いて効果的に訓練可能であり、強化学習におけるオンラインで段階的な学習を可能にするか?
  • RQ2方策勾配で訓練されたDDTの性能は、標準的な強化学習環境における深層ニューラルネットワークと比べてどうか?
  • RQ3人間の意思決定タスクにおいて、DDTと意思決定リストの解釈性はニューラルネットワークを著しく上回るか?
  • RQ4DDTの意思決定プロセスは、ニューラルネットワークと比較して、人間にとってより効率的で、ストレスが少ないか?
  • RQ5微分可能意思決定木におけるQ学習と方策勾配の最適化ダイナミクスはどのように異なり、どちらが学習に適しているか?

主な発見

  • 方策勾配で訓練されたDDTは、同じ環境においてバッチ学習済み意思決定木と比較して平均報酬が最大7倍にのぼった。
  • 方策勾配で訓練されたDDTは、全テスト済み強化学習ドメインで深層ニューラルネットワークのベースラインと同等またはそれ以上の性能を達成した。
  • ユーザースタディーでは、意思決定木と意思決定リストがワンホットMLPと比べて有意に高い解釈性と使いやすさが評価された(p < 0.001)。
  • 参加者はDDTおよび意思決定リストを用いた場合、簡略化されたMLPと比較して意思決定タスクを著しく迅速に完了した(p < 0.001)、これは高い効率性を示している。
  • 研究では、参加者が完全でバイナリ化されていないMLPを提示された場合、常にタスクを放棄すると報告しており、解釈可能なモデルとブラックボックスモデルとの間の使いやすさのギャップを浮き彫りにした。
  • 理論的分析により、最適化面の性質が有利であるため、方策勾配はQ学習よりも微分可能意思決定木の学習に安定的で適していることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。