[论文解读] AGIL: Learning Attention from Human for Visuomotor Tasks
该论文提出AGIL框架,通过从眼动数据中建模人类视觉注意力,提升了视觉-运动模仿学习的效果。通过训练眼动预测网络,并将其输出作为注意力引导整合进策略网络,AGIL在多个Atari游戏中显著提高了动作预测准确率和游戏表现,相较于标准模仿学习,得分提升最高达212.8%。
When intelligent agents learn visuomotor behaviors from human demonstrations, they may benefit from knowing where the human is allocating visual attention, which can be inferred from their gaze. A wealth of information regarding intelligent decision making is conveyed by human gaze allocation; hence, exploiting such information has the potential to improve the agents' performance. With this motivation, we propose the AGIL (Attention Guided Imitation Learning) framework. We collect high-quality human action and gaze data while playing Atari games in a carefully controlled experimental setting. Using these data, we first train a deep neural network that can predict human gaze positions and visual attention with high accuracy (the gaze network) and then train another network to predict human actions (the policy network). Incorporating the learned attention model from the gaze network into the policy network significantly improves the action prediction accuracy and task performance.
研究动机与目标
- 通过整合编码关键决策信息的人类视觉注意力,提升视觉-运动任务中的模仿学习效果。
- 将人类眼动行为建模为任务驱动的注意力机制,以反映视觉感知中的优先级。
- 开发一种框架,使眼动预测结果指导策略学习,使智能体能够更好地推断人类教师的内部决策状态。
- 证明注意力引导的模仿学习在准确率和性能上优于标准行为克隆方法。
- 提供一个公开可用的人类眼动与动作配对数据集,以支持视觉-运动学习研究。
提出的方法
- 使用高速眼动仪在Atari游戏游玩过程中收集高质量的人类眼动与动作数据。
- 训练一个深度神经网络(眼动网络),从原始游戏画面中高精度预测人类眼动位置与视觉注意力。
- 使用监督学习训练策略网络,以预测人类动作,其中注意力特征来自眼动网络的输出。
- 利用聚焦于眼动位置的伪像图像表示,模拟类人视觉感知,并指导策略网络。
- 将眼动网络生成的注意力图作为空间注意力模块集成到策略网络中,以突出任务相关的视觉特征。
- 通过在多个Atari游戏中评估行为匹配准确率与最终游戏得分,来衡量性能表现。
实验结果
研究问题
- RQ1人类眼动数据能否有效用于建模视觉-运动任务中的任务驱动视觉注意力?
- RQ2整合学习得到的人类注意力模型是否能提升模仿学习智能体的性能?
- RQ3在动作预测准确率与游戏表现方面,注意力引导的模仿学习与标准行为克隆相比表现如何?
- RQ4注意力在多大程度上能缓解高维视觉状态中的歧义,例如区分视觉上完全相同的多个目标?
- RQ5端到端深度学习模型能否在认知要求高、实时性要求强的视觉-运动任务中准确预测人类眼动?
主要发现
- AGIL在使用相同数据集的情况下,平均游戏得分相比标准模仿学习提高了212.8%,其中Seaquest的提升最为显著,达到788.9分对比252.2分。
- 眼动网络实现了高精度的人眼动预测,从而能够生成符合生物学合理性的伪像图像,准确反映人类视觉感知。
- 在MsPacman和Seaquest等存在多个视觉上完全相同的对象的游戏中,注意力引导使策略网络能够基于眼动信息正确推断目标,而标准卷积网络由于空间不变性无法实现此功能。
- 当存在多个与任务相关的目标时,注意力机制有助于消除动作歧义,例如区分位于玩家角色左侧或上方的敌人。
- 在多个游戏中(如Centipede和Riverraid),AGIL的表现甚至优于在2亿个样本上训练的深度Q网络(DQN),证明了其在样本效率方面的优势。
- 该框架表明,建模人类视觉注意力能显著提升模仿学习性能,尤其在复杂、多目标环境中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。