Skip to main content
QUICK REVIEW

[论文解读] PISA: A Binary-Weight Processing-In-Sensor Accelerator for Edge Image Processing

Shaahin Angizi, Sepehr Tabrizchi|arXiv (Cornell University)|Feb 18, 2022
Advanced Memory and Neural Computing被引用 11
一句话总结

PISA 是一种处理-传感器(PIS)加速器,利用基于非易失性存储器(NVM)的计算像素,在二值化权重神经网络(BWNNs)的第一层执行粗粒度卷积,显著降低了数据转换和传输的能耗。与基于 CPU-传感器的基线相比,其功耗降低了 84%,同时实现 1000 FPS 的帧率和 1.74 TOp/s/W 的能效。

ABSTRACT

This work proposes a Processing-In-Sensor Accelerator, namely PISA, as a flexible, energy-efficient, and high-performance solution for real-time and smart image processing in AI devices. PISA intrinsically implements a coarse-grained convolution operation in Binarized-Weight Neural Networks (BWNNs) leveraging a novel compute-pixel with non-volatile weight storage at the sensor side. This remarkably reduces the power consumption of data conversion and transmission to an off-chip processor. The design is completed with a bit-wise near-sensor processing-in-DRAM computing unit to process the remaining network layers. Once the object is detected, PISA switches to typical sensing mode to capture the image for a fine-grained convolution using only the near-sensor processing unit. Our circuit-to-application co-simulation results on a BWNN acceleration demonstrate acceptable accuracy on various image datasets in coarse-grained evaluation compared to baseline BWNN models, while PISA achieves a frame rate of 1000 and efficiency of ~1.74 TOp/s/W. Lastly, PISA substantially reduces data conversion and transmission energy by ~84% compared to a baseline CPU-sensor design.

研究动机与目标

  • 通过将计算更靠近传感器,解决边缘人工智能视觉系统中数据转换和传输的高能耗问题。
  • 克服传统冯·诺依曼架构在边缘设备中面临的功耗墙和内存墙瓶颈。
  • 通过低延迟、高吞吐量的传感器内计算设计,实现在物联网和边缘 AI 设备中的实时、节能图像处理。
  • 提出一种混合 PIS-PNS 架构,结合传感器内粗粒度处理与近传感器细粒度处理,以实现最优性能与能效。
  • 通过使用非易失性存储器实现对间歇性供电的鲁棒性,支持即时唤醒和低待机功耗,提升在能量采集系统中的可靠性。

提出的方法

  • 设计一种新型计算像素,内置非易失性存储器(NVM),用于存储二值化权重,并在模数转换前直接对光电流执行按位卷积运算。
  • 实现双模式运行:对 BWNN 的第一层执行传感器内处理,当检测到目标时切换至标准传感模式以进行细粒度处理。
  • 通过双行激活机制在 DRAM 单元中利用电荷共享,实现后续网络层的按位、近传感器 DRAM 内计算(PIM)。
  • 使用 65nm 工艺技术,从电路到应用层对整个系统进行协同仿真,将 PISA 与在 MNIST、SVHN 和 CIFAR-10 上训练的 BWNN 集成。
  • 通过最小化芯片外数据移动并消除冗余数据传输,实现基于早期传感器内特征提取的能效优化。
  • 采用可重构、可编程设计,支持在传感与处理模式之间动态切换,同时保持传感保真度。

实验结果

研究问题

  • RQ1在边缘人工智能视觉系统中,使用二值化权重的传感器内处理能否显著降低数据转换与传输的能耗?
  • RQ2在低功耗边缘设备中,将非易失性存储器集成到计算像素中,如何提升能效与断电恢复的鲁棒性?
  • RQ3混合 PIS-PNS 架构在实现超高吞吐量与低延迟的同时,能在多大程度上保持高精度?
  • RQ4与传统的基于 MAC 的设计相比,PIS 架构中使用按位运算的性能与能效权衡如何?
  • RQ5所提出的 PISA 设计在 MNIST、SVHN 和 CIFAR-10 等多样化图像数据集上的准确率与效率表现如何?

主要发现

  • PISA 在图像处理任务中实现了 1000 FPS 的帧率,证明了其在边缘人工智能应用中的实时性能。
  • 该加速器实现了 1.74 TOp/s/W 的能效,显著优于基线 CPU-传感器系统。
  • 与 CPU-传感器基线相比,PISA 将数据转换与传输能耗降低了约 84%,主要归因于消除了芯片外数据移动。
  • 在 MNIST、SVHN 和 CIFAR-10 数据集上,PISA 分别实现了 95.12%、90.35% 和 79.80% 的分类准确率,表明其在 BWNN 中具备可接受的准确度。
  • 计算像素在 65nm 工艺下占据 55×55 µm² 的面积,电路级仿真显示其功耗比同类 SRAM 设计(MACSen)降低 40%。
  • NVM 的使用实现了即时唤醒和低待机功耗,显著增强了在能量采集型物联网系统中常见的间歇性供电环境下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。