[论文解读] Dynamic Computational Time for Visual Attention
本文提出动态时间循环注意力模型(DT-RAM),作为循环视觉注意模型(RAM)的扩展,通过强化学习学习何时停止推理,从而实现每个输入的可变计算时间。通过在每一步添加继续/停止动作,DT-RAM在CUB-200-2011数据集上将平均推理时间减少了40%,同时保持了81.8%的最先进准确率。
We propose a dynamic computational time model to accelerate the average processing time for recurrent visual attention (RAM). Rather than attention with a fixed number of steps for each input image, the model learns to decide when to stop on the fly. To achieve this, we add an additional continue/stop action per time step to RAM and use reinforcement learning to learn both the optimal attention policy and stopping policy. The modification is simple but could dramatically save the average computational time while keeping the same recognition performance as RAM. Experimental results on CUB-200-2011 and Stanford Cars dataset demonstrate the dynamic computational model can work effectively for fine-grained image recognition.The source code of this paper can be obtained from https://github.com/baidu-research/DT-RAM
研究动机与目标
- 在视觉注意模型的推理过程中实现可变的计算时间,以适应输入的复杂度。
- 解决在循环注意网络中训练深度强化学习策略以实现动态停止的挑战。
- 在不牺牲准确率的前提下,提升细粒度图像识别的效率。
- 探索课程学习和中间监督作为长序列策略梯度训练稳定器的有效性。
- 证明动态计算时间可使简单样本的推理速度显著提升,同时在困难样本上保持性能。
提出的方法
- 在标准RAM架构的基础上,于每个时间步增加一个二元动作(继续/停止)。
- 使用强化学习(REINFORCE)联合优化注意力策略和停止策略。
- 通过逐步增加最大步数的方式应用课程学习,用于RAM的预训练。
- 使用预训练的RAM权重初始化DT-RAM,并通过策略梯度方法进行微调。
- 在每个时间步引入中间监督,以稳定长序列的训练。
- 在部分可观察马尔可夫决策过程(POMDP)框架下端到端训练,其中智能体决定何时停止关注。
实验结果
研究问题
- RQ1循环视觉注意模型能否根据输入复杂度动态调整其推理时间?
- RQ2添加可学习的停止策略是否能在不降低识别准确率的前提下提升计算效率?
- RQ3课程学习和中间监督在训练用于动态推理的深度强化学习策略方面有多有效?
- RQ4在细粒度识别中,不同图像难度水平下的停止步数分布如何变化?
- RQ5动态计算时间是否能在简单输入上实现显著加速,同时在困难样本上保持性能?
主要发现
- DT-RAM在CUB-200-2011数据集上达到81.8%的top-1准确率,与使用6步的标准RAM性能相当。
- DT-RAM使用的平均步数为3.6,相比使用6步的RAM,平均计算成本降低了40%。
- 在Stanford Cars数据集上,DT-RAM在最大3步的情况下,仅用平均3.6步即达到81.8%的准确率。
- CUB-200-2011上的停止步数分布显示,简单图像通常在1–2步内完成分类,而更难的图像则需要多达6步。
- 使用课程学习可提高训练稳定性,并确保性能随步数增加而提升,避免了从零开始训练时出现的性能下降。
- 中间监督显著提升了长序列下的性能,当使用6步时,若无中间监督,准确率会降至74.7%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。