Skip to main content
QUICK REVIEW

[论文解读] Channel Tiling for Improved Performance and Accuracy of Optical Neural Network Accelerators

Shurui Li, Mario Miscuglio|arXiv (Cornell University)|Nov 14, 2020
Neural Networks and Reservoir Computing参考文献 34被引用 5
一句话总结

本文提出通道铺砌(channel tiling)技术,用于4F光学神经网络加速器,以实现在光学域内对多通道卷积输出进行本征的光学域累加,从而消除对电子后处理的依赖。通过利用4F系统高分辨率特性,在传感器检测前光学地对通道求和,该方法在不增加额外光学硬件的前提下,实现了10–50倍的吞吐量提升,相机分辨率需求降低3倍,且对传感精度误差的容忍度提高33%,相比现有最先进方法表现更优。

ABSTRACT

Low latency, high throughput inference on Convolution Neural Networks (CNNs) remains a challenge, especially for applications requiring large input or large kernel sizes. 4F optics provides a solution to accelerate CNNs by converting convolutions into Fourier-domain point-wise multiplications that are computationally 'free' in optical domain. However, existing 4F CNN systems suffer from the all-positive sensor readout issue which makes the implementation of a multi-channel, multi-layer CNN not scalable or even impractical. In this paper we propose a simple channel tiling scheme for 4F CNN systems that utilizes the high resolution of 4F system to perform channel summation inherently in optical domain before sensor detection, so the outputs of different channels can be correctly accumulated. Compared to state of the art, channel tiling gives similar accuracy, significantly better robustness to sensing quantization (33\% improvement in required sensing precision) error and noise (10dB reduction in tolerable sensing noise), 0.5X total filters required, 10-50X+ throughput improvement and as much as 3X reduction in required output camera resolution/bandwidth. Not requiring any additional optical hardware, the proposed channel tiling approach addresses an important throughput and precision bottleneck of high-speed, massively-parallel optical 4F computing systems.

研究动机与目标

  • 解决因全正向传感器读出问题导致的4F光学卷积神经网络加速器在可扩展性和精度方面的瓶颈。
  • 在不增加额外光学硬件的前提下,实现多通道、多层卷积神经网络推理。
  • 提高系统对传感量化误差和光电检测噪声的鲁棒性。
  • 降低输出相机分辨率和带宽需求,这些是4F系统中的关键瓶颈。
  • 通过高效的铺砌策略,最大化利用4F系统的大规模并行性。

提出的方法

  • 提出一种通道铺砌方案,将卷积滤波器输出在傅里叶平面上进行空间排列,实现在光电检测前的光学域通道响应累加。
  • 利用4F系统高空间分辨率特性,将多个通道输出打包至单一光学场中,使检测过程中自然实现累加。
  • 将通道铺砌与输入或滤波器铺砌相结合,充分挖掘可用并行性,使系统利用率提升10–50倍。
  • 通过允许相机的非线性特性隐式应用激活函数,实现具有负权重的滤波器,避免使用复杂光学符号保持技术。
  • 设计基于FPGA的系统级接口,实现空间光调制器与相机之间的高速I/O同步,支持实时可编程的4F操作。
  • 开发与训练兼容的仿真模型,在网络微调过程中补偿系统非理想性。

实验结果

研究问题

  • RQ14F系统中是否可通过光学域通道求和,消除对多通道输出进行电子后处理的需求?
  • RQ2与现有方法相比,通道铺砌在传感量化误差和光电检测噪声方面的鲁棒性提升程度如何?
  • RQ3在不牺牲精度的前提下,通道铺砌在多大程度上可降低输出相机分辨率和带宽需求?
  • RQ4与伪负数方法相比,通道铺砌在4F卷积神经网络加速器中的性能与精度权衡如何?
  • RQ5通道铺砌是否能实现4F系统中大尺寸滤波器的高效利用,特别是在高分辨率输入场景下?

主要发现

  • 与现有最先进方法相比,通道铺砌使传感量化误差的鲁棒性提升33%,降低了对传感精度的需求。
  • 可容忍的传感噪声降低10 dB,显著增强了系统对光电检测噪声的抗性。
  • 该方法在不增加额外光学硬件的前提下,吞吐量相比现有方法提升10–50倍。
  • 输出相机分辨率和带宽需求至少降低3倍,有效缓解了4F系统中的主要瓶颈。
  • 在CIFAR-10数据集上使用VGG16时,通道铺砌相比其他铺砌方法使准确率提升36个百分点。
  • 由于增强了对噪声和量化误差的容忍度,该方法支持更快、位深更低的相机,从而实现更高运行速度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。