[论文解读] Hashing over Predicted Future Frames for Informed Exploration of Deep Reinforcement Learning
本文提出了一种新型的深度强化学习有知探索框架,利用深度动作条件预测模型预测未来帧,并通过具有局部敏感哈希(LSH)的卷积自编码器评估预测未来状态的新颖性。通过匹配预测帧与实际帧的哈希码,智能体可量化预测状态的访问频率,并选择通向最少探索轨迹的动作,与基线方法相比,显著提升了Atari 2600环境下的样本效率和性能。
In deep reinforcement learning (RL) tasks, an efficient exploration mechanism should be able to encourage an agent to take actions that lead to less frequent states which may yield higher accumulative future return. However, both knowing about the future and evaluating the frequentness of states are non-trivial tasks, especially for deep RL domains, where a state is represented by high-dimensional image frames. In this paper, we propose a novel informed exploration framework for deep RL, where we build the capability for an RL agent to predict over the future transitions and evaluate the frequentness for the predicted future frames in a meaningful manner. To this end, we train a deep prediction model to predict future frames given a state-action pair, and a convolutional autoencoder model to hash over the seen frames. In addition, to utilize the counts derived from the seen frames to evaluate the frequentness for the predicted frames, we tackle the challenge of matching the predicted future frames and their corresponding seen frames at the latent feature level. In this way, we derive a reliable metric for evaluating the novelty of the future direction pointed by each action, and hence inform the agent to explore the least frequent one.
研究动机与目标
- 为解决深度强化学习中典型高维连续状态空间(尤其在稀疏奖励环境)下的高效探索挑战。
- 开发一种机制,使智能体能够预测未来轨迹,并在不依赖随机探索的前提下评估预测状态的新颖性。
- 将基于模型的预测与哈希技术相结合,实现对未来状态访问频率的可靠估计。
- 克服标准探索启发式方法(如ε-贪婪)缺乏方向性且在复杂环境中失效的局限性。
- 通过利用预测的未来状态及其频率估计(基于学习的哈希码),实现确定性、基于知识的探索。
提出的方法
- 训练一个动作条件的深度预测模型,从给定的状态-动作对生成多步未来帧预测。
- 使用深度卷积自编码器从观测帧中提取高层特征,并应用局部敏感哈希(LSH)生成二进制哈希码,以实现高效的相似性搜索。
- 引入两阶段训练流程:首先通过重建损失预训练自编码器,然后通过码匹配损失微调,使预测帧的码与对应真实帧的码对齐。
- 在潜在特征层面将预测帧的哈希码与实际观测帧的哈希码匹配,以实现对预测状态访问频率的可靠计数。
- 基于预测未来状态哈希码的逆频率,为每个动作计算新颖性得分,引导智能体探索访问频率最低的未来轨迹。
- 将新颖性度量集成到DQN算法中,以基于预测状态新颖性的确定性动作选择替代随机探索。
实验结果
研究问题
- RQ1与随机探索相比,未来帧预测结合哈希是否能实现更高效且更具方向性的深度强化学习探索?
- RQ2如何有意义地将预测未来帧的哈希码与观测帧的哈希码匹配,以估计其访问频率?
- RQ3使用学习模型预测未来状态并评估其新颖性,是否能提升稀疏奖励环境下的样本效率和性能?
- RQ4基于预测状态频率的确定性探索策略,是否能在复杂环境中超越随机探索启发式方法(如ε-贪婪)?
- RQ5将基于模型的预测与哈希技术相结合,在Atari 2600等深度强化学习任务中,能在多大程度上提升探索性能?
主要发现
- 所提出的DQN-Informed-Hash方法在所有测试的Atari 2600环境中均优于DQN-Random、A3C和A3C-CTS,性能得分显著提升。
- 在Breakout环境中,DQN-Informed-Hash得分为451.93,而DQN-Informed无法推进(得分为0.93),表明该方法在稀疏奖励设置下具有明显优势。
- 在测试领域中,该方法相较先前最先进方法DQN-Informed,平均性能提升达15.6%。
- 第二阶段的码匹配损失将平均码损失从1以上降低至接近0,使预测帧的频率计数具有实际意义。
- 在码匹配微调后,重建质量略有下降,但预测帧仍保持语义合理性,并准确反映环境的关键动态。
- 哈希码有效捕捉了状态相似性:导致微小变化的动作(如无操作、向左)产生相似的哈希码,而引起显著变化的动作(如向右)则产生截然不同的哈希码。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。