[论文解读] Closing the Accuracy Gap in an Event-Based Visual Recognition Task
本文提出一种将基于帧的卷积神经网络(CNN)转换为事件驱动脉冲神经网络(SNN)的方法,以实现在机器人应用中低功耗、低延迟的视觉识别。通过使用L2正则化偏置重新训练CNN,并采用与DVS兼容的帧生成方法,所得到的SNN在计算量减少12倍的同时,达到了原始CNN准确率的97%(85.19% vs. 88.25%),显著缩小了事件驱动视觉识别任务中的准确率差距。
Mobile and embedded applications require neural networks-based pattern recognition systems to perform well under a tight computational budget. In contrast to commonly used synchronous, frame-based vision systems and CNNs, asynchronous, spiking neural networks driven by event-based visual input respond with low latency to sparse, salient features in the input, leading to high efficiency at run-time. The discrete nature of the event-based data streams makes direct training of asynchronous neural networks challenging. This paper studies asynchronous spiking neural networks, obtained by conversion from a conventional CNN trained on frame-based data. As an example, we consider a CNN trained to steer a robot to follow a moving target. We identify possible pitfalls of the conversion and demonstrate how the proposed solutions bring the classification accuracy of the asynchronous network to only 3\% below the performance of the original synchronous CNN, while requiring 12x fewer computations. While being applied to a simple task, this work is an important step towards low-power, fast, and embedded neural networks-based vision solutions for robotic applications.
研究动机与目标
- 解决在机器人视觉识别任务中,基于帧的CNN与事件驱动SNN之间的准确率差距问题。
- 利用动态视觉传感器(DVS)产生的异步事件流,实现高效、低功耗的推理。
- 识别并缓解从同步CNN转换为异步SNN过程中导致性能下降的关键原因。
- 证明SNN可在真实DVS数据上实现接近CNN的性能,同时将计算成本显著降低。
提出的方法
- 使用L2正则化偏置重新训练预训练的CNN,以防止极端权重的出现,提升SNN转换的保真度。
- 采用与真实DVS测试数据相同的时序分箱策略生成训练帧,最大限度减少域偏移。
- 通过时间编码将训练后CNN的激活映射为脉冲信号,实现CNN到SNN的转换。
- 在三种输入类型上评估SNN:模拟帧、泊松脉冲流和真实DVS事件流。
- 使用异步处理事件的脉冲神经网络推理引擎,实现稀疏、事件驱动的计算。
- 将计算成本度量为操作数(MOps),并在同一测试集上测量分类准确率。
实验结果
研究问题
- RQ1当在真实DVS事件流上测试时,导致基于帧的CNN与其转换后的SNN之间准确率差距的根本原因是什么?
- RQ2在SNN转换过程中,如何最小化训练数据与测试数据分布之间的差异?
- RQ3在训练期间使用L2正则化在多大程度上能提升SNN在异步事件输入下的性能?
- RQ4SNN是否能在真实事件驱动数据上实现接近CNN的准确率,同时将计算成本降低数个数量级?
主要发现
- 经L2正则化偏置重新训练的CNN转换得到的SNN,在真实DVS事件流上实现了85.19%的分类准确率,仅比原始CNN的88.25%低3%。
- 该SNN仅需0.66百万次操作(MOps),相比原始CNN的7.85 MOps,计算成本降低了12倍。
- 在训练过程中采用与DVS兼容的帧生成方法,显著减少了训练与测试数据之间的分布偏移,极大提升了SNN的鲁棒性。
- L2正则化有效缓解了极端权重和偏置对异步输入下SNN性能的负面影响。
- 剩余的3%准确率差距主要源于真实DVS数据中存在但合成或基于帧的训练数据中缺失的时间结构特征。
- 该SNN在模拟输入帧上实现了88.12%的准确率,计算量仅为1.15 MOps,相比原始CNN降低了7倍。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。