[论文解读] Towards Trainable Media: Using Waves for Neural Network-Style Training
本文提出了一种新型可训练光学介质,利用波的干涉实现类似神经网络的反向传播,通过前向波与误差波的乘法实现局部、基于梯度的权重更新。仿真结果表明,具有相位移位器的纳米光子芯片即使在非均匀损耗下,也能以极低误差(NRMSE ≈ 0.0015)完成矩阵-向量乘法,表明其在可扩展、低功耗人工智能加速器中的可行性。
In this paper we study the concept of using the interaction between waves and a trainable medium in order to construct a matrix-vector multiplier. In particular we study such a device in the context of the backpropagation algorithm, which is commonly used for training neural networks. Here, the weights of the connections between neurons are trained by multiplying a `forward' signal with a backwards propagating `error' signal. We show that this concept can be extended to trainable media, where the gradient for the local wave number is given by multiplying signal waves and error waves. We provide a numerical example of such a system with waves traveling freely in a trainable medium, and we discuss a potential way to build such a device in an integrated photonics chip.
研究动机与目标
- 开发一种物理介质,通过波相互作用计算梯度,模拟神经网络训练过程。
- 在可训练介质中利用波传播实现局部、双向的矩阵-向量乘法。
- 证明基于波的系统可在无需数字计算的情况下实现类似反向传播的学习。
- 探索在具有真实损耗和噪声的集成光子芯片上构建此类系统的可行性。
- 评估非均匀损耗和测量噪声对训练过程及收敛性的影响。
提出的方法
- 使用前向波与反向波模拟反向传播算法,通过信号波与误差波的乘积计算梯度。
- 采用物理梯度下降方法,根据前向波与误差波振幅乘积调整局部波数。
- 建模具有相位移位器的纳米光子芯片,通过调制波传播实现可训练的线性变换。
- 应用一种学习规则,根据前向波与误差波强度乘积的测量值更新相位移位器。
- 通过70层相位移位器阵列模拟波传播,包含真实光学损耗与非均匀衰减。
- 采用非正则化、局部学习规则,学习率固定或线性衰减,以改善收敛性。
实验结果
研究问题
- RQ1能否在物理介质中利用波的干涉实现类似反向传播的学习?
- RQ2非均匀光学损耗如何影响基于波的可训练介质的训练性能?
- RQ3局部物理梯度下降机制能否在光子芯片中实现精确的矩阵-向量乘法?
- RQ4测量噪声与低功耗探测对学习过程有何影响?
- RQ5在当前纳米光子元件与真实损耗条件下,该系统在多大程度上可实现可扩展性?
主要发现
- 在非均匀损耗下,系统成功学习实现矩阵-向量乘法,NRMSE约为0.007,当学习率线性衰减时降低至0.0015。
- 即使在70个相位移位器阵列中总功率损失达99%,训练过程仍保持稳定并收敛,表明对高损耗具有强鲁棒性。
- 最终的相位偏移被限制在狭窄范围内(±2π/10),表明实现有效学习并不需要完整的2π相位可调范围。
- 随时间降低学习率可显著改善收敛性,与固定学习率相比,NRMSE降低一个数量级。
- 非均匀损耗对NRMSE设定了下限,但训练过程本身并未因此受到关键性影响。
- 即使在低功耗测量条件下,该方法仍有效,因为所需测量速率远低于电信通信应用中的要求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。