[论文解读] Can Increasing Input Dimensionality Improve Deep Reinforcement Learning?
本文提出 OFENet,一种在线特征提取网络,采用深度 MLP-DenseNet 架构,通过预测未来观测的自监督辅助任务,从低维观测中学习高维状态表征。与传统观点相反,作者证明更高维的表征能显著提升深度强化学习中的样本效率和性能,尤其是在结合适当的表征学习时,其在连续控制基准测试中优于当前最先进方法。
Deep reinforcement learning (RL) algorithms have recently achieved remarkable successes in various sequential decision making tasks, leveraging advances in methods for training large deep networks. However, these methods usually require large amounts of training data, which is often a big problem for real-world applications. One natural question to ask is whether learning good representations for states and using larger networks helps in learning better policies. In this paper, we try to study if increasing input dimensionality helps improve performance and sample efficiency of model-free deep RL algorithms. To do so, we propose an online feature extractor network (OFENet) that uses neural nets to produce good representations to be used as inputs to deep RL algorithms. Even though the high dimensionality of input is usually supposed to make learning of RL agents more difficult, we show that the RL agents in fact learn more efficiently with the high-dimensional representation than with the lower-dimensional state observations. We believe that stronger feature propagation together with larger networks (and thus larger search space) allows RL agents to learn more complex functions of states and thus improves the sample efficiency. Through numerical experiments, we show that the proposed method outperforms several other state-of-the-art algorithms in terms of both sample efficiency and performance. Codes for the proposed method are available at http://www.merl.com/research/license/OFENet .
研究动机与目标
- 挑战传统观点,即低维状态表征能带来更好的强化学习性能。
- 探究通过学习高维特征增加输入维度,是否能提升深度强化学习中的样本效率和策略性能。
- 开发一种方法,实现有效的特征表征学习,且无需调整底层强化学习算法的超参数。
- 探索更大表征空间(通过更深更宽的网络实现)是否能让强化学习智能体发现更优策略。
- 评估辅助任务在学习有意义的高维表征中的影响,这些表征能增强策略学习。
提出的方法
- 提出 OFENet,一种神经网络,利用 MLP-DenseNet 架构将低维观测和动作映射为高维表征。
- 使用自监督辅助任务——预测未来观测——以在线方式与强化学习策略共同训练 OFENet。
- 在 MLP-DenseNet 中采用密集跳跃连接,以增强训练过程中的特征传播和梯度流动。
- 将 OFENet 所有层的输出拼接,形成富含信息的高维表征,保留任务相关特征。
- 将 OFENet 表征作为标准深度强化学习算法(如 SAC)的输入,不修改策略网络或超参数。
- 使用相同的经验回放缓冲区,端到端联合训练 OFENet 与强化学习智能体,实现表征与策略的联合优化。
实验结果
研究问题
- RQ1通过学习高维表征增加输入维度,是否能提升深度强化学习中的样本效率?
- RQ2预测未来观测的自监督辅助任务,是否能带来比随机或固定表征更好的策略学习效果?
- RQ3高维表征的优势是否依赖于表征学习过程的质量,还是仅维度本身即足够?
- RQ4OFENet 表征的大小如何影响强化学习智能体的性能和学习速度?
- RQ5OFENet 是否能在不修改底层强化学习算法的前提下,提升多种连续控制环境中的性能?
主要发现
- 在 HalfCheetah-v2 和 Ant-v2 等基准连续控制任务中,OFENet 在样本效率和最终性能方面均优于多个当前最先进深度强化学习算法。
- 即使底层强化学习算法(SAC)保持不变,该方法仍能实现更优性能,表明表征学习可与策略学习解耦。
- 将 OFENet 表征维度从 4 单位增加到 128 单位,在 HalfCheetah-v2 上带来单调的性能提升,直至达到饱和点。
- 仅通过增加策略网络参数量(相同参数量基线)而不进行有效的表征学习,无法达到 OFENet 的性能,表明表征质量比模型大小本身更为关键。
- 在训练前冻结 OFENet(freeze-ofe)会导致性能显著下降,表明与强化学习策略进行在线、联合训练对有效表征学习至关重要。
- 预测未来观测的辅助任务至关重要——若不使用该任务训练 OFENet(no-aux),性能会显著下降,证明任务感知的表征学习对成功至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。