Skip to main content
QUICK REVIEW

[论文解读] Boosting Trust Region Policy Optimization by Normalizing Flows Policy

Yunhao Tang, Shipra Agrawal|arXiv (Cornell University)|Sep 27, 2018
Reinforcement Learning in Robotics参考文献 23被引用 20
一句话总结

本文提出将归一化流(NF)作为策略架构,以增强信任区域策略优化(TRPO),通过生成多样化、非高斯的动作分布,实现更有效的探索。NF策略减轻了KL散度约束的限制性影响,从而实现更快的收敛速度和更优的性能表现——尤其在高维、复杂控制任务中,相较于标准高斯策略,NF策略在TRPO与ACKTR框架下均表现更优。

ABSTRACT

We propose to improve trust region policy search with normalizing flows policy. We illustrate that when the trust region is constructed by KL divergence constraints, normalizing flows policy generates samples far from the 'center' of the previous policy iterate, which potentially enables better exploration and helps avoid bad local optima. Through extensive comparisons, we show that the normalizing flows policy significantly improves upon baseline architectures especially on high-dimensional tasks with complex dynamics.

研究动机与目标

  • 通过使用更具表达能力的归一化流(NF)策略替代标准高斯策略,以改进信任区域策略优化(TRPO)。
  • 探究NF策略是否能够缓解TRPO中KL散度约束的限制性影响,从而实现更好的探索与更快的收敛速度。
  • 评估NF策略在具有复杂动力学特性的多样化高维控制任务中的鲁棒性与性能表现。
  • 在TRPO与ACKTR框架中,将NF策略与基线架构(如分解高斯分布)进行比较,评估其在样本效率与最终性能方面的提升。

提出的方法

  • 采用基于连续归一化流的策略参数化方法,实现灵活、多模态且具有相关性的动作分布。
  • 在TRPO与ACKTR中集成NF策略,通过保持连续策略之间KL散度的信任区域约束,确保训练稳定性。
  • 使用包含K个耦合层的归一化流,其中每一层应用具有可学习参数的可逆变换,并通过神经网络嵌入将流条件化于状态。
  • 为实现计算可行性,采用Fisher信息矩阵近似KL散度约束,同时保留信任区域的几何特性。
  • 使用基于优势加权的策略梯度更新进行策略训练,其中NF策略的似然比通过变量变换公式计算。
  • 采用状态条件化流:NF的输入为两层MLP生成的状态嵌入,使策略能够根据状态自适应建模复杂动作分布。

实验结果

研究问题

  • RQ1归一化流策略是否能通过减轻KL散度约束的限制性影响,提升信任区域策略优化中的探索能力?
  • RQ2在具有复杂动力学特性的高维控制任务中,归一化流策略与标准高斯策略的性能表现如何比较?
  • RQ3使用归一化流是否能增强对超参数设置(如KL约束阈值ε)的鲁棒性?
  • RQ4当与TRPO和ACKTR结合时,归一化流策略在多大程度上提升了样本效率与最终性能?

主要发现

  • 在高维MuJoCo与Roboschool任务中,归一化流策略显著优于分解高斯策略,尤其在Ant与Humanoid环境中,分别实现了约800与2000的渐近回报。
  • 在HalfCheetah任务中,NF策略实现了约1500的回报,而高斯策略完全无法学习(回报≈0),表明在复杂动力学下存在关键性能差距。
  • NF策略对超参数设置(尤其是KL约束阈值ε)表现出更优的鲁棒性,即使在ε值较小时,其采样行为也更具灵活性。
  • 在ACKTR框架中,NF策略在复杂任务(如Ant与Humanoid)中始终优于高斯策略,其中Humanoid任务的性能提升达2000 vs. 550。
  • NF策略在多个基准测试中达到最先进性能,其结果与先前工作(如Schulman et al., 2017b; Wu et al., 2017)相当或更优,甚至在更少训练步数下实现。
  • 消融实验表明,NF策略性能对流层数(K ∈ {2,4,6})与隐藏单元数(l₁ ∈ {3,5,7})的变化具有鲁棒性,表明其设计稳定且可扩展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。