Skip to main content
QUICK REVIEW

[论文解读] A Layered Architecture for Active Perception: Image Classification using Deep Reinforcement Learning

Hossein Mousavi, Guangyi Liu|arXiv (Cornell University)|Sep 20, 2019
Reinforcement Learning in Robotics参考文献 26被引用 7
一句话总结

本文提出了一种用于图像分类中主动感知的三层深度强化学习架构,其中机器人通过规划中间目标和动作来探索部分可观察环境,以最大化分类准确率。该方法使用统一的奖励信号和广义策略梯度学习,在 MNIST 上实现了 94.61% 的测试准确率,通过分层规划和可解释的探索轨迹提升了性能。

ABSTRACT

We propose a planning and perception mechanism for a robot (agent), that can only observe the underlying environment partially, in order to solve an image classification problem. A three-layer architecture is suggested that consists of a meta-layer that decides the intermediate goals, an action-layer that selects local actions as the agent navigates towards a goal, and a classification-layer that evaluates the reward and makes a prediction. We design and implement these layers using deep reinforcement learning. A generalized policy gradient algorithm is utilized to learn the parameters of these layers to maximize the expected reward. Our proposed methodology is tested on the MNIST dataset of handwritten digits, which provides us with a level of explainability while interpreting the agent's intermediate goals and course of action.

研究动机与目标

  • 开发一种基于机器人、在部分可观察条件下通过战略性探索实现图像分类的主动感知系统。
  • 通过统一的深度强化学习框架,协同设计目标规划、动作选择与图像分类。
  • 通过使中间目标和动作透明且可解释,实现可解释的决策过程。
  • 通过分层探索而非直接动作序列,提升分类性能。
  • 在不使用过拟合抑制技术的情况下,展示模型的泛化能力与鲁棒性,利用全卷积网络和全局平均池化。

提出的方法

  • 该架构由三层构成:元层用于高层目标生成,动作层用于局部导航,分类层用于奖励评估与预测。
  • 采用广义策略梯度算法,通过优化从分类性能导出的单一统一奖励信号,联合训练所有层级。
  • 元层选择中间目标,引导探索向信息丰富的图像区域推进,而非要求精确达到目标状态。
  • 动作层执行朝向当前目标的动作,若环境仍为部分可观察,可灵活提前停止。
  • 分类层评估智能体的当前观测,计算奖励,并使用带有全局平均池化的全卷积网络输出预测。
  • 系统在 MNIST 上端到端训练,采用分层训练策略,先对分类器进行预训练,再微调规划模块。

实验结果

研究问题

  • RQ1在部分可观察条件下,机器人如何主动探索图像以提升分类准确率?
  • RQ2统一的奖励信号是否能有效训练分层深度强化学习框架中的规划与感知模块?
  • RQ3与随机或非分层动作选择相比,分层目标规划在多大程度上提升了分类性能?
  • RQ4在不使用显式正则化技术的情况下,模型性能如何在未见测试数据上泛化?
  • RQ5中间目标和动作是否可被解释为智能体决策过程中可解释的步骤?

主要发现

  • 该模型在 MNIST 数据集上实现了 94.61% ± 0.17% 的测试准确率,尽管未使用显式正则化,仍表现出强大的泛化能力。
  • 在测试集上,Top-2 准确率达到 98.30%,表明真实标签通常位于模型预测的前两位。
  • 当分类器在使用完整图像的独立评估中表现时,达到了 94.92% 的测试准确率,证实规划层成功揭示了信息丰富的图像区域。
  • 使用预训练的 ResNet-18 进行迁移学习,将训练时间减少了近一个数量级,测试准确率达到 95.19%。
  • 消融实验表明,目标规划使预测误差减少了约三分之一,增加动作规划后误差再减少三分之一。
  • 样本轨迹显示,智能体始终聚焦于信息丰富的图像区域,低置信度预测通常源于关键特征(如数字 '4' 的顶部)未被完整覆盖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。