Skip to main content
QUICK REVIEW

[论文解读] ASP Vision: Optically Computing the First Layer of Convolutional Neural Networks using Angle Sensitive Pixels

Huaijin Chen, Suren Jayasuriya|arXiv (Cornell University)|May 11, 2016
Advanced Memory and Neural Computing参考文献 42被引用 10
一句话总结

本文提出 ASP Vision,一种能效更高的成像系统,利用仿生角度敏感像素(ASPs)光学计算卷积神经网络(CNN)的第一卷积层。通过用可直接提取边缘特征的角度敏感像素(ASPs)替代传统图像传感器,该系统降低了传感器功耗、数据带宽和后续CNN的浮点运算量(FLOPS),在真实硬件原型上实现了数字和人脸图像识别任务的接近基线准确率。

ABSTRACT

Deep learning using convolutional neural networks (CNNs) is quickly becoming the state-of-the-art for challenging computer vision applications. However, deep learning's power consumption and bandwidth requirements currently limit its application in embedded and mobile systems with tight energy budgets. In this paper, we explore the energy savings of optically computing the first layer of CNNs. To do so, we utilize bio-inspired Angle Sensitive Pixels (ASPs), custom CMOS diffractive image sensors which act similar to Gabor filter banks in the V1 layer of the human visual cortex. ASPs replace both image sensing and the first layer of a conventional CNN by directly performing optical edge filtering, saving sensing energy, data bandwidth, and CNN FLOPS to compute. Our experimental results (both on synthetic data and a hardware prototype) for a variety of vision tasks such as digit recognition, object recognition, and face identification demonstrate using ASPs while achieving similar performance compared to traditional deep learning pipelines.

研究动机与目标

  • 解决传统 CNN 在嵌入式和移动视觉系统中功耗高和带宽受限的问题。
  • 通过用能效更高的角度敏感像素(ASPs)替代传统图像传感器,降低图像传感和数据传输的能耗。
  • 利用 ASP 实现 CNN 第一层的光学计算,以最小化下游计算负载和 FLOPS。
  • 在真实硬件上验证 ASP Vision 系统在数字识别和人脸识别等视觉任务中的可行性与性能。

提出的方法

  • 利用角度敏感像素(ASPs),即具有 Gabor 类脉冲响应的定制 CMOS 衍射图像传感器,执行类似于人类视觉皮层 V1 层的光学边缘滤波。
  • 用单个光学计算阶段替代传统图像传感和 CNN 第一卷积层,直接输出边缘滤波响应。
  • 设计一个硬件原型,采用 64×96 分辨率的 ASP 传感器(由 4×6 个 10µm 像素阵列组成),在 180nm CMOS 工艺下制造,并搭配尼康 F1.2 镜头用于真实世界成像。
  • 在合成和真实数据生成的 ASP 边缘响应上训练并评估标准 CNN(LeNet、NiN),通过数据增强提升鲁棒性。
  • 通过对比传统流水线,分析 ASP Vision 在传感器功耗、数据传输和 FLOPS 减少方面的能效与带宽节省。
  • 实现噪声抑制技术,如固定图案噪声减除,并考虑未来改进,如相关双采样和工业级 CMOS 制造工艺。

实验结果

研究问题

  • RQ1角度敏感像素(ASPs)能否通过光学计算有效模拟 CNN 第一卷积层的特征提取?
  • RQ2基于 ASP 的光学计算在嵌入式视觉系统中,能在多大程度上降低传感器功耗和数据带宽?
  • RQ3在真实世界任务中,基于 ASP 生成的边缘响应训练的 CNN 性能,与基于传统图像数据训练的模型相比如何?
  • RQ4当前 ASP 原型在噪声、分辨率和光效率方面的实际限制是什么,它们如何影响识别准确率?

主要发现

  • 在 MNIST 数据集上,ASP Vision 在使用数据增强后达到 94.61% 的准确率,与基线 LeNet 的 95.22% 相当,表现接近。
  • 在人脸图像识别任务中,ASP Vision 在数据增强下达到 94.18% 的准确率,与 NiN 在增强数据集上的基线准确率 94.73% 相当。
  • 未使用数据增强时,ASP Vision 在 MNIST 上达到 86.7% 的准确率,在人脸识别任务中为 82.87%,性能差距约为 5–10%,但通过数据增强得以弥补。
  • 硬件原型表明,尽管存在高噪声和图像保真度有限,ASPs 生成的真实世界边缘响应仍足以支持高精度视觉识别。
  • 通过仅编码边缘响应,系统显著降低了传感器功耗和数据带宽,减少了对 CPU 高带宽数据传输的需求。
  • 原型性能受限于读出电路噪声和非工业级制造工艺,但未来通过电路设计优化和工艺技术升级,可显著提升信号保真度和系统效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。