[论文解读] Deep Reinforcement Learning Discovers Internal Models
本文提出了半聚合马尔可夫决策过程(SAMDP),一种通过在DQN激活的t-SNE可视化结果上进行时间感知聚类,自动从深度强化学习策略中提取层次化时空结构(如技能和子目标)的模型。该方法实现了可解释的策略分析,并通过共享自主机制提升性能,在雅达利游戏中最高实现36%的得分提升,方法在预测策略失败时触发专家干预。
Deep Reinforcement Learning (DRL) is a trending field of research, showing great promise in challenging problems such as playing Atari, solving Go and controlling robots. While DRL agents perform well in practice we are still lacking the tools to analayze their performance. In this work we present the Semi-Aggregated MDP (SAMDP) model. A model best suited to describe policies exhibiting both spatial and temporal hierarchies. We describe its advantages for analyzing trained policies over other modeling approaches, and show that under the right state representation, like that of DQN agents, SAMDP can help to identify skills. We detail the automatic process of creating it from recorded trajectories, up to presenting it on t-SNE maps. We explain how to evaluate its fitness and show surprising results indicating high compatibility with the policy at hand. We conclude by showing how using the SAMDP model, an extra performance gain can be squeezed from the agent.
研究动机与目标
- 在无需人工特征工程的情况下,自动发现训练好的DRL策略内部的层次化结构(如技能和子目标)。
- 开发一种模型,通过识别状态表示中的空间与时间抽象,为DRL智能体的行为提供人类可解释的解释。
- 通过一种共享自主框架实现性能提升,该框架利用SAMDP模型检测并干预高风险策略行为。
- 使用价值函数一致性与策略-奖励相关性等定量标准评估所提取模型的保真度。
提出的方法
- 从DQN神经激活轨迹构建t-SNE图,以在低维空间中可视化状态表示。
- 应用时间感知聚类算法,将状态聚类为表示不同技能或子目标的半聚合状态。
- 从轨迹中经验性估计转移概率和奖励函数,以构建SAMDP模型。
- 使用三项评估标准:价值函数一致性(VMSE)、贪婪策略动作与轨迹奖励之间的相关性,以及策略转移与高-低奖励轨迹之间的相关性。
- 实现共享自主机制:若轨迹匹配低奖励行为(T⁻)的可能性超过高奖励行为(T⁺)的可能性,则触发“弹出”按钮以终止并实施干预。
- 使用SAMDP模型预测易出错的状态,并在不重新训练DQN的情况下引导专家干预。
实验结果
研究问题
- RQ1是否能够仅通过状态激活轨迹的、数据驱动的自动方法,识别DQN策略中的有意义技能和子目标?
- RQ2SAMDP模型在多大程度上捕捉了底层MDP的真实动态与奖励结构?
- RQ3SAMDP模型能否用于检测DQN策略可能失败的时刻,从而实现实时专家干预?
- RQ4SAMDP模型在不重新训练原始DQN智能体的前提下,能在多大程度上提升策略性能?
主要发现
- 在Breakout游戏中,SAMDP模型通过在预测策略将失败时触发专家干预,实现了平均36%的性能提升。
- 该模型表现出良好的价值函数一致性,DQN Q值与SAMDP预测值在各状态间具有高度相关性(VMSE)。
- 观察到贪婪策略动作与高奖励轨迹之间存在正相关性(平均corr_i > 0),证实了模型的一致性。
- 贪婪策略的转移矩阵与高奖励轨迹(T⁺)的相关性高于与低奖励轨迹(T⁻)的相关性,验证了模型的保真度。
- 该方法成功识别出具有明确启动与终止集合的清晰技能,即使在无手动标注或监督的情况下亦然。
- 该模型在不重新训练的前提下实现了性能提升,证明了基于内部模型发现的共享自主的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。