[论文解读] RecLight: A Recurrent Neural Network Accelerator with Integrated Silicon Photonics
RecLight 是一种光子硬件加速器,利用集成硅光子学加速循环神经网络(RNN)的推理,包括门控循环单元(GRUs)和长短期记忆网络(LSTMs)。通过利用光学矩阵乘法和低延迟光互连,其每比特能耗比当前最先进水平低 37 倍,吞吐量高出 10%,在实时序列处理工作负载中展现出显著的能效优势。
Recurrent Neural Networks (RNNs) are used in applications that learn dependencies in data sequences, such as speech recognition, human activity recognition, and anomaly detection. In recent years, newer RNN variants, such as GRUs and LSTMs, have been used for implementing these applications. As many of these applications are employed in real-time scenarios, accelerating RNN/LSTM/GRU inference is crucial. In this paper, we propose a novel photonic hardware accelerator called RecLight for accelerating simple RNNs, GRUs, and LSTMs. Simulation results indicate that RecLight achieves 37x lower energy-per-bit and 10% better throughput compared to the state-of-the-art.
研究动机与目标
- 为满足语音识别和异常检测等实时序列处理应用中日益增长的能效推理需求。
- 克服电子加速器在处理循环神经网络(RNNs)、GRUs 和 LSTMs 时面临的能耗和延迟瓶颈。
- 设计一种新型光子加速器架构,将硅光子学与 RNN 工作负载集成,实现高吞吐量和低能耗。
- 证明通过利用光学并行性和低损耗传输,光子计算可在 RNN 推理中超越电子实现方案。
- 通过仿真验证所提出架构,展示在能效和吞吐量方面的可测量改进。
提出的方法
- 该架构使用可重构光子网格并行执行矩阵乘法,利用硅光子学的速度和能效优势。
- 采用马赫-曾德尔干涉仪(MZIs)作为可调谐光相位调制器,实现 RNN 层中的可学习权重。
- 系统集成光互连以减少处理单元之间的通信延迟,最小化电子瓶颈。
- 采用混合电子-光子控制层管理光器件配置,并协调 RNN 中各时间步的计算。
- 通过动态重构光路,该设计支持从简单 RNN 到 GRUs 和 LSTMs 等更复杂变体的灵活适配。
- 采用标准 RNN 基准进行仿真,以在真实工作负载下评估能效和吞吐量。
实验结果
研究问题
- RQ1与电子加速器相比,集成硅光子学能否显著降低 RNN 推理的每比特能耗?
- RQ2光子 RNN 加速器的吞吐量与最先进的电子实现方案相比如何?
- RQ3光学并行性和低损耗互连在循环神经网络工作负载中能带来多大程度的性能提升?
- RQ4在 RNN 中用光子等效替代电子矩阵乘法时,可实现的能效与性能权衡如何?
- RQ5所提出的光子架构在实现卓越能效的同时,能否在序列建模任务中保持高精度?
主要发现
- RecLight 相比最先进电子 RNN 加速器,实现了 37 倍更低的每比特能耗,展现出能效的显著飞跃。
- 该加速器的吞吐量比现有最佳电子解决方案高出 10%,表明计算吞吐量得到提升。
- 光子网格架构实现了低延迟的并行矩阵乘法,充分利用了光信号的高带宽特性。
- 利用可调谐 MZIs 实现权重配置,支持在不同 RNN 变体(包括 GRUs 和 LSTMs)之间灵活重构。
- 仿真结果证实,该光子设计在显著降低能耗的同时,与标准 RNN 工作负载保持兼容性。
- 结果表明,光子加速是实时序列处理中电子加速的可行且更优的替代方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。