Skip to main content
QUICK REVIEW

[论文解读] Light-in-the-loop: using a photonics co-processor for scalable training of neural networks

Julien Launay, Iacopo Poli|arXiv (Cornell University)|Jun 2, 2020
Neural Networks and Reservoir Computing参考文献 16被引用 5
一句话总结

该论文首次通过直接反馈对齐(DFA)实现了基于光学随机投影的光子协同处理器在神经网络训练中的实验演示,采用离轴全息技术实现大规模光学随机投影。该系统在MNIST数据集上实现了95.8%的测试准确率,投影速率达1.5 kHz,功耗最高为30W,为大规模模型训练提供了一种可扩展、低功耗的GPU替代方案。

ABSTRACT

As neural networks grow larger and more complex and data-hungry, training costs are skyrocketing. Especially when lifelong learning is necessary, such as in recommender systems or self-driving cars, this might soon become unsustainable. In this study, we present the first optical co-processor able to accelerate the training phase of digitally-implemented neural networks. We rely on direct feedback alignment as an alternative to backpropagation, and perform the error projection step optically. Leveraging the optical random projections delivered by our co-processor, we demonstrate its use to train a neural network for handwritten digits recognition.

研究动机与目标

  • 为应对大规模神经网络训练日益增长的计算与能耗成本,特别是在推荐系统或自动驾驶汽车等终身学习场景中。
  • 开发一种混合模拟-数字训练加速器,通过直接反馈对齐(DFA)绕过反向传播的串行依赖关系。
  • 证明光子协同处理器可有效执行DFA所必需的大规模、低功耗随机投影。
  • 通过将误差投影步骤卸载至光学域,同时保留数字推理能力,实现深度神经网络的可扩展、无内存训练。

提出的方法

  • 采用直接反馈对齐(DFA)作为反向传播的替代方法,通过使用固定随机矩阵将全局误差投影至每一层,从而解耦层更新。
  • 利用LightOn公司的光学处理单元(OPU)结合离轴全息技术,光学计算误差向量的随机投影,实现高速、低功耗的线性变换。
  • 通过空间光调制器将误差向量编码至相干光束,再经由扩散介质传播,生成由相机捕获的散斑图案。
  • 利用干涉式离轴全息技术重建复值投影向量,恢复误差向量的光学随机投影。
  • 将光学投影集成至数字训练循环中:光子协同处理器计算权重更新的误差信号,而前向传播仍由数字硬件完成。
  • 对误差向量进行量化处理,取值为±1或0,以适配光学输入设备,最大限度减少信号失真,同时保持训练性能。

实验结果

研究问题

  • RQ1光子协同处理器能否通过光学方式有效加速大规模随机投影,从而实现深度神经网络的训练?
  • RQ2在标准基准测试中,光学DFA的性能与标准反向传播相比,在准确率和收敛性方面表现如何?
  • RQ3通过离轴全息技术实现的光学随机投影在规模和速度方面能扩展到多大程度,同时保持用于大规模模型训练的数值保真度?
  • RQ4该混合光学-数字方法能否在大规模神经网络训练中实现相对于GPU训练的显著能效提升?
  • RQ5当前光学硬件在输入尺寸、输出分辨率以及与数字训练流水线集成方面存在哪些实际限制?

主要发现

  • 光子协同处理器成功以1.5 kHz的速率完成光学随机投影,最大输出尺寸约为10^5个元素。
  • 该系统在MNIST手写数字识别任务上,采用光学DFA训练流程,实现了95.8%的测试准确率。
  • 在GPU上使用学习率为0.001的相同训练设置,准确率达到97.6%;非量化误差版本达到97.7%,表明量化导致的性能差距较小。
  • 光学系统功耗仅约30W,表明在大规模训练中,能效相比GPU有望提升一个数量级。
  • 该架构与神经网络结构无关,且无需存储中间梯度,支持可扩展部署。
  • 通过切换至相位移全息技术,未来实现10^6量级输入/输出维度的扩展是可行的,支持万亿参数级别的计算。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。