[论文解读] Causality-driven Hierarchical Structure Discovery for Reinforcement Learning
本文提出CDHRL,一种基于因果驱动的分层强化学习框架,通过利用环境变量之间的因果依赖关系,自动发现高质量的子目标层次结构,替代低效的随机探索。该方法通过迭代提升因果发现与子目标层次结构构建,显著提高了在2D-Minecraft和Eden等复杂环境中的探索效率与学习速度,优于当前最先进方法。
Hierarchical reinforcement learning (HRL) effectively improves agents' exploration efficiency on tasks with sparse reward, with the guide of high-quality hierarchical structures (e.g., subgoals or options). However, how to automatically discover high-quality hierarchical structures is still a great challenge. Previous HRL methods can hardly discover the hierarchical structures in complex environments due to the low exploration efficiency by exploiting the randomness-driven exploration paradigm. To address this issue, we propose CDHRL, a causality-driven hierarchical reinforcement learning framework, leveraging a causality-driven discovery instead of a randomness-driven exploration to effectively build high-quality hierarchical structures in complicated environments. The key insight is that the causalities among environment variables are naturally fit for modeling reachable subgoals and their dependencies and can perfectly guide to build high-quality hierarchical structures. The results in two complex environments, 2D-Minecraft and Eden, show that CDHRL significantly boosts exploration efficiency with the causality-driven paradigm.
研究动机与目标
- 解决由随机探索范式导致的分层强化学习中探索效率低下的问题。
- 在稀疏奖励的复杂环境中,自动发现高质量的层次结构(子目标及其依赖关系)。
- 用因果驱动的发现替代随机探索,以提升子目标层次结构构建的质量与效率。
- 实现因果发现与子目标层次结构构建之间的迭代式、相互增强的进展。
- 提升具有复杂子目标依赖关系环境中的训练效率与最终性能。
提出的方法
- CDHRL采用一种迭代提升框架,交替进行因果发现与子目标层次结构构建。
- 因果发现通过使用基于子目标策略收集的干预数据,识别可控环境变量之间的因果关系。
- 子目标层次结构构建通过识别可控变量变化所对应的可到达子目标,并基于已发现的因果依赖关系进行组织。
- 该框架利用分层策略生成有针对性的干预数据,提升因果图的准确性,从而实现更高效的发现。
- 利用因果结构推断子目标的学习顺序,确保依赖关系得到尊重,提升训练稳定性。
- 在基于图像的环境中,该方法集成了解耦编码器,以提取离散的环境变量用于因果分析。
实验结果
研究问题
- RQ1能否有效利用环境变量之间的因果关系,以指导强化学习中的层次结构发现?
- RQ2基于因果驱动的发现范式是否在发现高质量子目标层次结构方面优于随机探索?
- RQ3因果发现与子目标层次结构构建之间的迭代交互如何提升学习效率?
- RQ4基于因果关系的层次结构在复杂环境中能在多大程度上提升探索效率与训练速度?
- RQ5基于因果关系的子目标排序是否能带来比非因果方法更稳定、更快的收敛?
主要发现
- CDHRL通过用因果驱动发现替代随机探索,在2D-Minecraft和Eden中显著提升了探索效率。
- 与基于随机动作的训练相比,使用分层策略干预数据学习到的因果图在结构汉明距离(SHD)和结构干预距离(SID)上更接近真实因果结构。
- 在Eden中,CDHRL在MeatIncrease和SatietyIncrease等子目标上实现了比MEGA更快且更稳定的训练收敛,尤其得益于因果关系引导的正确子目标排序。
- 该方法能够发现长期因果路径(如Stick → Iron Ore),同时跳过中间的短期路径,从而提升训练速度与泛化能力。
- 通过因果关系构建的子目标层次结构显著缩小了动作空间,提升了多级策略训练的效率。
- CDHRL在最终性能与学习速度方面均优于当前最先进的HRL方法,如HAC和课程学习增强型HRL。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。