[论文解读] Deep Transformer Q-Networks for Partially Observable Reinforcement Learning
该论文提出了一种新型强化学习架构——深度变换器Q网络(DTQN),其在部分可观察环境中的智能体历史建模中引入了变换器解码器的自注意力机制。通过在整个观察历史中对中间Q值进行训练,DTQN实现了比循环基线方法更快、更稳定的训练,其在多个POMDP基准测试中均表现出更高的成功率和泛化能力。
Real-world reinforcement learning tasks often involve some form of partial observability where the observations only give a partial or noisy view of the true state of the world. Such tasks typically require some form of memory, where the agent has access to multiple past observations, in order to perform well. One popular way to incorporate memory is by using a recurrent neural network to access the agent's history. However, recurrent neural networks in reinforcement learning are often fragile and difficult to train, susceptible to catastrophic forgetting and sometimes fail completely as a result. In this work, we propose Deep Transformer Q-Networks (DTQN), a novel architecture utilizing transformers and self-attention to encode an agent's history. DTQN is designed modularly, and we compare results against several modifications to our base model. Our experiments demonstrate the transformer can solve partially observable tasks faster and more stably than previous recurrent approaches.
研究动机与目标
- 为解决强化学习中因观测噪声或不完整导致智能体无法获取完整状态信息的局部可观测性挑战。
- 克服在部分可观察领域中,LSTM和GRU等循环神经网络(RNN)常出现的训练不稳定和脆弱性问题。
- 探究在自然语言处理中以序列建模能力著称的变换器,是否能有效编码智能体历史并提升POMDP中的学习性能。
- 设计一种模块化、可解释且鲁棒的架构,使其在部分可观察环境中优于现有的基于RNN的方法。
- 为未来在部分可观察设置下基于变换器的强化学习研究,提供一个可重用、可扩展的代码库。
提出的方法
- DTQN采用带有可学习位置编码的变换器解码器,处理智能体的观测与动作历史,实现长距离依赖建模。
- 模型使用因果掩码确保自回归生成,防止推理过程中泄露未来观测信息。
- 提出一种新型训练策略——中间Q值预测,即在历史每个时间步生成的Q值上进行网络训练,而不仅限于最终时间步。
- 架构中引入门控跳跃连接和恒等映射重排,以提升训练稳定性和梯度流动。
- 位置编码采用端到端可学习方式,而非固定形式(如正弦编码),使模型能够适应特定环境的时序动态。
- 推理阶段仅使用最终时间步的Q值选择动作,而训练阶段则利用所有中间预测提供更强监督信号。
实验结果
研究问题
- RQ1基于变换器的架构是否能在部分可观察强化学习任务中超越基于RNN的方法?
- RQ2与标准单步预测相比,中间Q值预测是否能提升训练稳定性和最终性能?
- RQ3在POMDP环境中,不同位置编码策略——可学习、正弦或无编码——对性能有何影响?
- RQ4DTQN中的自注意力机制是否能学习关注语义相关的过去观测,如注意力可视化所示?
- RQ5DTQN的模块化设计是否允许对架构组件进行有效的消融分析和比较?
主要发现
- 在GridVerse记忆7x7环境中,DTQN取得了75.2%的成功率,优于基线RNN方法及所有消融变体。
- 在记忆卡任务中,DTQN达到89.8%的成功率,显著高于无中间Q值预测变体的9.0%成功率。
- 无位置编码的变体在记忆卡任务中表现较差(70.8%),且低于可学习和正弦编码版本,表明位置编码对性能至关重要。
- 采用中间Q值预测的模型平均成功率为87.77%,而未使用该策略的模型仅为52.69%,证明该训练策略在性能中起关键作用。
- GridVerse中的注意力可视化显示,模型对绿色信标观测表现出强烈关注,证实模型已学会关注任务关键信息。
- DTQN在所有评估环境中表现具有竞争力或更优,包括Hallway和GridVerse,且在学习速度和稳定性方面均有持续提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。