Skip to main content
QUICK REVIEW

[论文解读] Incremental Learning for Robot Perception through HRI

Sepehr Valipour, Camilo Perez|arXiv (Cornell University)|Jan 17, 2017
Multimodal Machine Learning Applications参考文献 14被引用 4
一句话总结

本文提出了一种由人机交互(HRI)驱动的增量学习框架,使机器人能够通过主动的人类指导持续提升视觉感知能力。通过结合基于深度学习的物体检测与识别技术,以及通过指点和语音指令实现实时的人类反馈,机器人逐步扩展其知识库,在添加大量新物体类别后仍能保持稳定性能(top-1准确率 >0.45),且未出现灾难性遗忘现象。

ABSTRACT

Scene understanding and object recognition is a difficult to achieve yet crucial skill for robots. Recently, Convolutional Neural Networks (CNN), have shown success in this task. However, there is still a gap between their performance on image datasets and real-world robotics scenarios. We present a novel paradigm for incrementally improving a robot's visual perception through active human interaction. In this paradigm, the user introduces novel objects to the robot by means of pointing and voice commands. Given this information, the robot visually explores the object and adds images from it to re-train the perception module. Our base perception module is based on recent development in object detection and recognition using deep learning. Our method leverages state of the art CNNs from off-line batch learning, human guidance, robot exploration and incremental on-line learning.

研究动机与目标

  • 解决现实环境中物体类别动态变化且事先无法完全知晓的机器人感知挑战。
  • 使机器人能够通过自然的人机交互(如指点和口头标注)逐步学习新物体类别。
  • 开发一种系统,在持续增加新类别的同时保持高识别准确率,避免灾难性遗忘。
  • 通过交互式、基于话语的学习建立人类与机器人之间的知识共识。
  • 展示在现实机器人应用(如电子车间辅助)中实现增量视觉感知的可行性。

提出的方法

  • 系统使用基于RPN和CNN的预训练深度学习模型进行实时物体检测与识别,推理时间在GeForce 960 GPU上为150ms。
  • 通过人类交互引入新物体类别:用户指向物体并口头标注,建立共同知识基础。
  • 机器人自主使用其机载摄像头探索物体,收集多张图像以重新训练感知模块。
  • 利用新收集的图像对模型进行增量微调,更新分类器头以包含新类别。
  • 该方法利用现成的最先进CNN模型实现初始感知,随后应用在线增量学习以适应新数据。
  • 性能通过top-1准确率和平均精度(AP)进行评估,指标在包含旧类别和新类别的测试集上计算。

实验结果

研究问题

  • RQ1机器人能否通过持续的人机交互,逐步扩展其视觉感知能力,同时不遗忘先前学习的类别?
  • RQ2当逐步添加新物体类别时,深度学习模型的识别准确率如何退化?这种退化能否被最小化?
  • RQ3机器人通过人机引导探索所收集的图像,在增量学习场景中与ImageNet等通用数据集相比,性能表现如何?
  • RQ4自然的人机交互(指点和语音指令)能否作为教学新物体类别的可扩展且可靠的方法?
  • RQ5在物体检测与识别中引入时间一致性,如何提升长期感知的鲁棒性?

主要发现

  • 系统保持了高水平的识别性能,基线模型的top-1准确率达到0.45,考虑到MS-COCO数据集的难度,这一结果在预期范围内。
  • 在逐步添加新物体类别后,模型的准确率仅呈现低斜率下降,表明即使在多次添加后,灾难性遗忘现象也极轻微。
  • 机器人通过HRI收集的图像性能几乎等同于ImageNet图像,仅略有准确率下降,表明机器人收集的数据在增量学习中极为有效。
  • 系统在消费级GPU上实现每帧150ms的实时推理,速度优于R-CNN,同时平均精度(0.2026)与最先进水平(0.224)相比具有竞争力。
  • 人类指导与机器人探索的结合,实现了新物体类别的可靠且可扩展的学习,已在真实电子车间场景中得到验证。
  • 系统总准确率(要求同时满足正确定位(IoU > 0.5)和正确分类)达到0.1704,表明在增量设置下,定位与识别均具挑战性但可管理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。