Skip to main content
QUICK REVIEW

[論文レビュー] Visualizing Dynamics: from t-SNE to SEMI-MDPs

Nir Ben-Zrihem, Tom Zahavy|arXiv (Cornell University)|Jun 22, 2016
Reinforcement Learning in Robotics参考文献 22被引用数 12
ひとこと要約

本稿では、t-SNEで埋め込まれたニューラルアクティベーションに対する時間に依存するクラスタリングを用いて、深層Qネットワーク(DQN)の表現から完全に自動的に半マルコフ決定過程(SMDP)モデルを発見・可視化する手法を提案する。この手法により、ドメイン知識を必要とせず、階層的な時間的抽象化とポリシー構造が明らかになる。アタリ環境における学習済みスキルの可視的解釈と尤度ベースの評価によって検証されている。

ABSTRACT

Deep Reinforcement Learning (DRL) is a trending field of research, showing great promise in many challenging problems such as playing Atari, solving Go and controlling robots. While DRL agents perform well in practice we are still missing the tools to analayze their performance and visualize the temporal abstractions that they learn. In this paper, we present a novel method that automatically discovers an internal Semi Markov Decision Process (SMDP) model in the Deep Q Network's (DQN) learned representation. We suggest a novel visualization method that represents the SMDP model by a directed graph and visualize it above a t-SNE map. We show how can we interpret the agent's policy and give evidence for the hierarchical state aggregation that DQNs are learning automatically. Our algorithm is fully automatic, does not require any domain specific knowledge and is evaluated by a novel likelihood based evaluation criteria.

研究の動機と目的

  • 深層強化学習エージェントにおける時間的抽象化を分析・可視化するためのツールの不足に対処すること。
  • ドメイン固有の知識や手動による特徴工学を必要とせず、DQNの表現から内部的な半マルコフ決定過程(SMDP)モデルを自動で発見すること。
  • SMDP構造をt-SNEマップ上に重ねて可視化するフレームワークを構築し、DQNポリシーの解釈可能性を高めること。
  • 新たな尤度ベースの基準と経路報酬との相関を用いて、発見されたSMDPモデルの品質を評価すること。

提案手法

  • DQNエージェントを訓練し、評価中の状態訪問履歴、ニューラルアクティベーション、Q値、価値推定値を記録する。
  • DQNの最終層アクティベーションに対してt-SNE次元削減を適用し、局所構造を保持する2次元埋め込みを生成する。
  • 時間的文脈(ウィンドウサイズwのスライディングウインドウ)を組み込んだ新しい時間に依存するクラスタリングアルゴリズムを用い、t-SNEポイントを動的特性が類似する状態を表すクラスタにグループ化する。
  • クラスタリングされたデータから経験的頻度を用いて遷移確率と報酬を推定することでSMDPモデルを適合させる。
  • t-SNEマップ上にSMDPを有向グラフとして可視化し、ノードをクラスタ、エッジを遷移とする。
  • 3つの基準を用いてモデル品質を評価する:価値関数の一貫性(VMSE)、グリーディポリシー選択と経路報酬との相関、グリーディポリシーと上位・下位報酬経路との相関。

実験結果

リサーチクエスチョン

  • RQ1訓練済みDQNの内部表現から、事前知識がなくとも構造的かつ解釈可能なSMDPモデルを自動で発見できるか?
  • RQ2発見されたSMDPは、DQNポリシーにおける意味的な時間的抽象化と階層的状態集約を適切に反映しているか?
  • RQ3SMDPモデルを用いて、視覚的および定量的評価を通じてエージェント行動を説明できるか?
  • RQ4報酬相関と価値の一貫性で測定した場合、SMDPモデルは実際のエージェント行動をどれほどよく予測できるか?

主な発見

  • ブレイクアウト環境では、明確で解釈可能なスキルがSMDPモデルによって明らかになった。例えば、クラスタ10は明確な左トンネル掘削ポリシーを示していた。
  • 遷移エントロピーが高かったクラスタ(例:ブレイクアウトにおけるクラスタ6および16)は、より曇ったポリシーと不確実性の高い平均状態を示し、学習された行動の曇り具合を示していた。
  • パックマンでは、クラスタが空間的に局所化されており、明確なエージェント位置(例:北西のクラスタ19、南東のクラスタ9)を示しており、位置ベースの状態抽象化が確認された。
  • SMDP価値関数はDQNのQ値と高い相関を示し、VMSEで測定したモデルの適合度が良好であることが示された。
  • グリーディポリシーの遷移選択は、高報酬経路と正の相関を示しており、低報酬経路よりも高報酬経路との相関が高かった。
  • モデルはスパースな遷移行列を示しており、各クラスタが他のクラスタの小さなサブセットへのみ遷移していることから、明確で局所化されたスキルの存在が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。