Skip to main content
QUICK REVIEW

[论文解读] Imitation Learning with Human Eye Gaze via Multi-Objective Prediction

Ravi Kumar Thakur, MD-Nazmus Samin Sunbeam|arXiv (Cornell University)|Feb 25, 2021
Gaze Tracking and Assistive Technology被引用 4
一句话总结

本文提出了一种名为Gaze-Regularized Imitation Learning(GRIL)的多目标深度学习框架,通过联合预测人类动作与眼动,提升视觉模仿学习中的样本效率与泛化能力。GRIL在逼真的四旋翼无人机导航任务中表现优于当前最先进方法,能够泛化至未见过的场景,并准确预测人类视觉注意力模式。

ABSTRACT

Approaches for teaching learning agents via human demonstrations have been widely studied and successfully applied to multiple domains. However, the majority of imitation learning work utilizes only behavioral information from the demonstrator, i.e. which actions were taken, and ignores other useful information. In particular, eye gaze information can give valuable insight towards where the demonstrator is allocating visual attention, and holds the potential to improve agent performance and generalization. In this work, we propose Gaze Regularized Imitation Learning (GRIL), a novel context-aware, imitation learning architecture that learns concurrently from both human demonstrations and eye gaze to solve tasks where visual attention provides important context. We apply GRIL to a visual navigation task, in which an unmanned quadrotor is trained to search for and navigate to a target vehicle in a photorealistic simulated environment. We show that GRIL outperforms several state-of-the-art gaze-based imitation learning algorithms, simultaneously learns to predict human visual attention, and generalizes to scenarios not present in the training data. Supplemental videos and code can be found at https://sites.google.com/view/gaze-regularized-il/.

研究动机与目标

  • 通过将人类眼动作为上下文信号,提升模仿学习的样本效率与泛化能力。
  • 开发一种上下文感知的端到端架构,同时从人类动作与眼动数据中进行学习。
  • 证明在如自主四旋翼无人机导航等复杂高维控制任务中,眼动正则化方法的有效性。
  • 实现对训练期间未见过的新场景(如移动目标或新环境)的泛化能力。
  • 为现有眼动增强的模仿学习方法提供一种更简单、参数效率更高的替代方案。

提出的方法

  • GRIL采用多目标学习架构,包含共享编码器与两个并行分支:一个用于预测控制动作,另一个用于预测眼动坐标。
  • 模型使用人类示范数据以监督方式训练,数据包括每一步的时间戳下的RGB图像、控制指令与眼动坐标。
  • 多任务损失函数结合了动作预测与眼动预测的均方误差(MSE)损失,实现联合优化。
  • 眼动预测分支作为正则化器,促使策略关注与任务相关的显著视觉特征。
  • 架构使用单一共享主干网络提取视觉特征,减少参数量并提升训练效率。
  • 该方法在逼真的AirSim仿真环境中,针对自主四旋翼无人机导航至目标车辆的任务进行了评估。

实验结果

研究问题

  • RQ1联合预测人类动作与眼动是否能提升复杂视觉控制任务中模仿学习的样本效率?
  • RQ2眼动正则化如何提升策略在未见场景(如移动目标或新环境)中的泛化能力?
  • RQ3直接预测眼动坐标的多目标架构是否优于需要眼动热力图或独立眼动网络的方法?
  • RQ4GRIL能否在导航过程中复现人类类似的眼动注意力模式,如目标注视或障碍物扫视?
  • RQ5眼动预测损失在高维连续控制设置中对模型鲁棒性与泛化能力有何影响?

主要发现

  • GRIL在四旋翼无人机导航任务中显著优于标准行为克隆方法以及两种最先进的眼动增强方法(AGIL与CGL)。
  • GRIL在涉及移动目标的新任务中表现出有效泛化能力,展现出超越训练分布的鲁棒性。
  • 该模型成功学习到预测人类视觉注意力模式,包括目标注视、扫视与障碍物注视,与人类示范观察结果一致。
  • 与依赖眼动热力图与KL散度的CGL相比,GRIL在更少参数与更简单损失函数下实现更优性能。
  • 眼动预测分支作为有效正则化器,降低过拟合与Rademacher复杂度,从而提升泛化能力。
  • GRIL的联合优化框架通过共享表征学习,使策略更专注于任务相关的视觉特征,实现更高效的训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。