[论文解读] Visualizing Dynamics: from t-SNE to SEMI-MDPs
本文提出一种完全自动化的方法,从深度Q网络(DQN)表示中发现并可视化半马尔可夫决策过程(SMDP)模型,利用t-SNE嵌入的神经激活进行时间感知聚类。该方法在无需领域知识的情况下揭示了分层的时间抽象和策略结构,通过基于似然的评估和Atari环境中学习技能的可视化解释进行验证。
Deep Reinforcement Learning (DRL) is a trending field of research, showing great promise in many challenging problems such as playing Atari, solving Go and controlling robots. While DRL agents perform well in practice we are still missing the tools to analayze their performance and visualize the temporal abstractions that they learn. In this paper, we present a novel method that automatically discovers an internal Semi Markov Decision Process (SMDP) model in the Deep Q Network's (DQN) learned representation. We suggest a novel visualization method that represents the SMDP model by a directed graph and visualize it above a t-SNE map. We show how can we interpret the agent's policy and give evidence for the hierarchical state aggregation that DQNs are learning automatically. Our algorithm is fully automatic, does not require any domain specific knowledge and is evaluated by a novel likelihood based evaluation criteria.
研究动机与目标
- 为解决深度强化学习智能体中时间抽象分析与可视化的工具缺乏问题。
- 在无需领域特定知识或人工特征工程的情况下,自动从DQN表示中发现内部半马尔可夫决策过程(SMDP)模型。
- 开发一种可视化框架,将SMDP结构叠加在t-SNE图上,以提升DQN策略的可解释性。
- 通过新颖的基于似然的评估标准以及与轨迹奖励的相关性,评估所发现的SMDP模型质量。
提出的方法
- 训练DQN智能体,并在评估过程中记录状态访问、神经激活、Q值和价值估计。
- 对DQN最后一层激活应用t-SNE降维,生成保留局部结构的二维嵌入。
- 使用一种新颖的时间感知聚类算法,结合时间上下文(大小为w的滑动窗口),将t-SNE点聚类为表示具有相似动态特性的状态的簇。
- 通过经验频率估计簇数据的转移概率和奖励,拟合SMDP模型。
- 将SMDP可视化为t-SNE图上的有向图,节点为簇,边为转移。
- 使用三项标准评估模型质量:价值函数一致性(VMSE)、贪婪策略选择与轨迹奖励之间的相关性,以及贪婪策略与高/低奖励轨迹之间的相关性。
实验结果
研究问题
- RQ1我们能否在无先验知识的情况下,自动从训练好的DQN内部表示中发现结构化且可解释的SMDP模型?
- RQ2所发现的SMDP是否反映了DQN策略中的有意义的时间抽象和分层状态聚合?
- RQ3SMDP模型能否通过可视化和定量评估解释智能体的行为?
- RQ4SMDP模型在多大程度上能预测实际智能体行为,以奖励相关性和价值一致性为衡量标准?
主要发现
- 在Breakout环境中,SMDP模型揭示了清晰可解释的技能,例如簇10表现出明确的左隧道挖掘策略。
- 转移熵较高的簇(如Breakout中的簇6和16)表现出较不清晰的策略和更模糊的平均状态,表明学习行为存在不确定性。
- 在Pacman中,簇在空间上具有局部性,表现出明确的智能体位置(如西北部的簇19,东南部的簇9),证实了基于位置的状态抽象。
- SMDP价值函数与DQN的Q值高度相关,表明VMSE度量下的模型拟合度良好。
- 贪婪策略的转移选择与高奖励轨迹正相关,且与高奖励路径的相关性高于与低奖励路径的相关性。
- 该模型实现了稀疏转移矩阵,表明每个簇仅会转移到其他簇的一个小子集,支持了明确且局部化的技能存在。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。