[论文解读] Event-Driven Visual-Tactile Sensing and Learning for Robots
本论文提出了一种基于脉冲神经网络(SNN)的事件驱动视觉-触觉感知系统,采用神经形态触觉传感器(NeuTouch)和视觉-触觉脉冲神经网络(VT-SNN),实现了高效、低延迟的机器人感知。该系统在物体分类和旋转滑移检测任务中达到具有竞争力的准确率,仅使用触觉信号时准确率最高达91%,且在Intel Loihi芯片上的功耗比GPU低1,900倍,展示了面向智能机器人应用的可扩展、高能效感知框架。
This work contributes an event-driven visual-tactile perception system, comprising a novel biologically-inspired tactile sensor and multi-modal spike-based learning. Our neuromorphic fingertip tactile sensor, NeuTouch, scales well with the number of taxels thanks to its event-based nature. Likewise, our Visual-Tactile Spiking Neural Network (VT-SNN) enables fast perception when coupled with event sensors. We evaluate our visual-tactile system (using the NeuTouch and Prophesee event camera) on two robot tasks: container classification and rotational slip detection. On both tasks, we observe good accuracies relative to standard deep learning methods. We have made our visual-tactile datasets freely-available to encourage research on multi-modal event-driven robot perception, which we believe is a promising approach towards intelligent power-efficient robot systems.
研究动机与目标
- 开发一种可扩展的事件驱动触觉传感系统,用于机器人末端执行器,实现实时、低功耗的触觉感知。
- 通过提出一种异步、事件驱动的感知框架,克服同步深度学习的局限性,该框架模仿生物神经处理机制。
- 利用脉冲神经网络(SNN)融合视觉与触觉事件数据,提升机器人任务中的感知准确率与速度。
- 通过在物体分类与滑移检测任务上的系统性实验,验证端到端事件驱动感知在机器人应用中的可行性。
- 发布首个公开可用的事件驱动视觉-触觉数据集,以加速多模态、低功耗机器人感知研究。
提出的方法
- 设计并制造了NeuTouch,一种39个触觉像素(taxel)的神经形态指尖传感器,可生成与触觉刺激成比例的异步脉冲事件,实现可扩展且低延迟的触觉感知。
- 将NeuTouch传感器与Prophesee事件相机集成,捕获异步的视觉与触觉事件流,实现多模态感知。
- 开发了视觉-触觉脉冲神经网络(VT-SNN),通过时间加权脉冲计数损失函数处理视觉与触觉脉冲序列,以促进早期分类。
- 使用基于脉冲的反向传播训练VT-SNN,并引入一种新型损失函数($\mathcal{L}_{\omega}$),赋予早期脉冲更高权重,从而提升响应速度。
- 在GPU(RTX 2080Ti)和Intel Loihi神经形态芯片上部署训练好的VT-SNN,以在实时仿真条件下对比延迟与功耗效率。
- 采用时间分箱推理协议(1ms步长)模拟真实世界数据流,并在不同硬件平台上比较性能。
实验结果
研究问题
- RQ1像NeuTouch这样的事件驱动触觉传感器能否在保持低延迟与低功耗的前提下,有效扩展至更高触觉像素数量?
- RQ2在多模态事件数据(视觉与触觉)上训练的脉冲神经网络,是否能在机器人感知任务中实现与标准人工神经网络(ANNs)相当或更优的性能?
- RQ3时间加权脉冲计数损失是否能提升事件驱动感知系统中的早期分类性能?
- RQ4与传统GPU推理相比,事件驱动感知系统在实时机器人应用中能将功耗降低多少?
- RQ5公开可用的事件驱动视觉-触觉数据集能否加速多模态、低功耗机器人感知研究?
主要发现
- VT-SNN在同时使用视觉与触觉模态时实现了100%的物体分类准确率,在仅使用触觉事件时,采用加权脉冲计数损失($\mathcal{L}_{\omega}$)也达到了91%的准确率,优于MLP-GRU基线模型(87%)在纯触觉数据上的表现。
- 在旋转滑移检测任务中,VT-SNN在双模态下实现了100%的分类准确率(1.00),仅使用触觉信号时也达到91%的准确率,表明其具备强大的早期检测能力。
- VT-SNN在Intel Loihi芯片上的推理延迟为1,039.9 μs,与GPU(1,045.6 μs)相当,但功耗仅为32.3 mW,远低于GPU的61,930 mW,功耗降低达1,900倍。
- 加权脉冲计数损失($\mathcal{L}_{\omega}$)显著提升了早期分类性能,在刺激输入的前0.05秒内即观察到更高的准确率。
- 系统在滑移发生后0.08秒内即完成检测,视觉-触觉脉冲处理周期约为1 ms,实现了真正的实时响应。
- 作者发布了首个公开可用的事件驱动视觉-触觉数据集,包含RGB图像、本体感觉数据及事件流,以支持未来多模态、事件驱动机器人研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。