Skip to main content
QUICK REVIEW

[论文解读] AnalogNet: Convolutional Neural Network Inference on Analog Focal Plane Sensor Processors

Matthew Z. Wong, Benoît Guillard|arXiv (Cornell University)|Jun 2, 2020
CCD and CMOS Imaging Sensors被引用 8
一句话总结

AnalogNet 提出了一种用于模拟焦点平面传感器处理器(FPSP)的新型卷积神经网络(CNN)推理框架,通过在传感器芯片上直接执行计算,实现了高速、低功耗的图像处理。该方法采用一种对模拟计算噪声具有鲁棒性的定制训练方法,在 MNIST 数据集上实现了 96.9% 的准确率,帧率为 2260 FPS,每帧仅消耗 0.7 mJ 能量。

ABSTRACT

We present a high-speed, energy-efficient Convolutional Neural Network (CNN) architecture utilising the capabilities of a unique class of devices known as analog Focal Plane Sensor Processors (FPSP), in which the sensor and the processor are embedded together on the same silicon chip. Unlike traditional vision systems, where the sensor array sends collected data to a separate processor for processing, FPSPs allow data to be processed on the imaging device itself. This unique architecture enables ultra-fast image processing and high energy efficiency, at the expense of limited processing resources and approximate computations. In this work, we show how to convert standard CNNs to FPSP code, and demonstrate a method of training networks to increase their robustness to analog computation errors. Our proposed architecture, coined AnalogNet, reaches a testing accuracy of 96.9% on the MNIST handwritten digits recognition task, at a speed of 2260 FPS, for a cost of 0.7 mJ per frame.

研究动机与目标

  • 为了实现在集成传感器与处理器于同一芯片的模拟焦点平面传感器处理器(FPSP)上的高效且准确的 CNN 推理。
  • 为解决 FPSP 在深度学习工作负载中固有的内存受限和模拟计算噪声问题。
  • 开发一种训练方法,以增强网络对模拟计算近似特性的鲁棒性。
  • 通过标准基准(MNIST)在真实硬件上展示高帧率、低功耗的推理性能。

提出的方法

  • 设计一种定制的训练流程,通过引入噪声建模来提升网络对模拟计算误差的鲁棒性。
  • 利用优化的数据流和计算调度,在 SCAMP-5 FPSP 上将标准 CNN 层映射为 FPSP 兼容代码。
  • 利用 SCAMP-5 FPSP 的 256×256 个处理单元(PE)阵列,在图像数据的原位执行并行模拟计算。
  • 实现一种针对 FPSP 硬件约束(包括有限内存和信号退化)量身定制的单卷积层 CNN 架构。
  • 应用感知噪声的权重量化和随机训练技术,以增强对模拟硬件不准确性的抗性。
  • 通过最小化数据移动并利用焦点平面处理模型来优化推理,从而降低能耗。

实验结果

研究问题

  • RQ1尽管存在内存受限和模拟算术噪声,标准 CNN 是否仍可有效映射到模拟 FPSP 上?
  • RQ2如何调整训练流程以提升在 FPSP 推理中对模拟计算误差的鲁棒性?
  • RQ3与数字处理器相比,在焦点平面上直接执行 CNN 推理能带来多大的性能和能效提升?
  • RQ4在当前 FPSP 硬件上,多层计算导致的数据丢失和稀疏性在多大程度上限制了 CNN 的可扩展性?
  • RQ5FPSP 是否能够实现适用于嵌入式和机器人应用的实时、低功耗推理?

主要发现

  • AnalogNet 在 SCAMP-5 FPSP 上使用单卷积层 CNN 在 MNIST 数据集上实现了 96.9% 的测试准确率。
  • 系统实现了 2260 FPS 的帧率,其推理速度和能效显著优于 CPU、GPU 和 VPU。
  • 在 SCAMP-5 上测得的每帧能耗仅为 0.7 mJ,涵盖所有处理和数据操作,其能效优于 CPU、GPU 和 VPU 系统。
  • FPSP 的总能耗成本低于 CPU、GPU 和 VPU 的保守下限,后者未包含图像采集和数据传输的能耗。
  • 重复模拟操作(如除法和乘法)引起的噪声导致信号退化并增加方差,测试案例中标准差从 ~2 上升至 ~6.3。
  • 本研究识别出数据丢失和池化导致的空间稀疏性是当前 FPSP 硬件上将 CNN 扩展至单个卷积层以上的根本挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。