[论文解读] Backpropagation through nonlinear units for all-optical training of neural networks
本文提出了一种实用的全光反向传播方案,利用可饱和吸收实现非线性激活,并通过泵浦-探测配置近似梯度计算。仿真结果表明,该方法在MNIST数据集上实现了与数字网络相当的性能,达到最先进的准确率,即使在深层网络架构中也表现优异,且仅使用无源光学元件和真实的光学深度。
Backpropagation through nonlinear neurons is an outstanding challenge to the field of optical neural networks and the major conceptual barrier to all-optical training schemes. Each neuron is required to exhibit a directionally dependent response to propagating optical signals, with the backwards response conditioned on the forward signal, which is highly non-trivial to implement optically. We propose a practical and surprisingly simple solution that uses saturable absorption to provide the network nonlinearity. We find that the backward propagating gradients required to train the network can be approximated in a pump-probe scheme that requires only passive optical elements. Simulations show that, with readily obtainable optical depths, our approach can achieve equivalent performance to state-of-the-art computational networks on image classification benchmarks, even in deep networks with multiple sequential gradient approximations. This scheme is compatible with leading optical neural network proposals and therefore provides a feasible path towards end-to-end optical training.
研究动机与目标
- 为解决在全光神经网络中通过非线性光学神经元反向传播梯度的根本性挑战。
- 通过解决非线性光学元件中方向依赖响应的问题,实现端到端的光学训练。
- 开发一种与现有光学神经网络平台兼容、仅使用无源光学元件的方法。
- 证明通过可饱和吸收实现的梯度近似可达到与数字反向传播相当的性能。
提出的方法
- 利用可饱和吸收作为光学非线性,其天然具备方向不对称响应,适用于反向传播。
- 采用泵浦-探测方案来近似反向传播的梯度,其中探测信号的透射率取决于前向信号的强度。
- 通过一个随机函数 f(z) 近似激活函数的导数,利用加权标量积测量其与真实导数 g'(z) 的相似度。
- 应用柯西-施瓦茨不等式来界定近似误差,确保在导数不准确的情况下仍能实现稳定训练。
- 在可饱和吸收的非线性工作区范围内,使用高斯输入分布来建模训练期间神经元的输入。
- 采用标准优化方法(Adam)并结合批量归一化和输入缩放,根据光学深度调整输入范围以提升收敛性。
实验结果
研究问题
- RQ1光学系统中的可饱和吸收能否为通过非线性神经元的反向传播提供必要的方向不对称响应?
- RQ2在单次光学通路中,利用无源泵浦-探测方案对激活函数真实导数的近似程度如何?
- RQ3使用此类近似梯度的全光训练能否在标准基准测试中实现与数字反向传播相当的性能?
- RQ4导数近似误差对深层光学神经网络中网络收敛性和准确率的影响如何?
主要发现
- 所提方法在使用可饱和吸收非线性的卷积网络上于MNIST数据集上实现了99.5±0.1%的测试准确率,与采用ReLU激活函数的数字网络性能相当。
- 采用可饱和吸收训练的全连接网络在MNIST数据集上达到了98.0±0.2%的准确率,与交叉熵和均方误差基线方法性能相当。
- 即使在深层网络中存在多次连续梯度近似的情况下,该方法仍保持有效,表现出对误差累积的鲁棒性。
- 性能对权重初始化敏感,尤其在低光学深度下,需采用定制化初始化策略(如双峰分布)以实现收敛。
- 将输入强度重新缩放至更高范围(如0–5或0–15)可显著提升深层卷积网络中采用可饱和吸收时的收敛速度。
- 通过基于柯西-施瓦茨不等式的相似度度量,对导数近似误差进行了界定,确保在导数估计不完美时仍能实现稳定训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。