Skip to main content
QUICK REVIEW

[论文解读] Automated Optical Multi-layer Design via Deep Reinforcement Learning

Haozhu Wang, Zeyu Zheng|arXiv (Cornell University)|Jun 21, 2020
Advanced optical system design参考文献 37被引用 4
一句话总结

该论文提出 OML-PPO,一种深度强化学习框架,将多层光学设计建模为序列生成问题,采用自定义循环网络的近端策略优化方法,以发现高性能的薄膜结构。在两项与能源相关的任务中,其性能优于人工设计和最先进的启发式设计:在五层超宽带吸收器中实现了97.64%的平均吸收率,在四十二层白炽灯滤光片中实现了16.60的可见光增强因子,较一种记忆算法高出8.5%。

ABSTRACT

Optical multi-layer thin films are widely used in optical and energy applications requiring photonic designs. Engineers often design such structures based on their physical intuition. However, solely relying on human experts can be time-consuming and may lead to sub-optimal designs, especially when the design space is large. In this work, we frame the multi-layer optical design task as a sequence generation problem. A deep sequence generation network is proposed for efficiently generating optical layer sequences. We train the deep sequence generation network with proximal policy optimization to generate multi-layer structures with desired properties. The proposed method is applied to two energy applications. Our algorithm successfully discovered high-performance designs, outperforming structures designed by human experts in task 1, and a state-of-the-art memetic algorithm in task 2.

研究动机与目标

  • 为解决在大规模设计空间中,由人工专家主导的多层光学薄膜设计效率低下且次优的问题。
  • 开发一种可扩展的、基于学习的方法,无需依赖手工设计的启发式规则,用于组合式光学设计。
  • 实现对未知最优层数的近似最优多层结构的自动发现。
  • 在宽带吸收器和白炽灯滤光片等能源应用中提升设计性能。
  • 通过与人工设计和最先进的启发式算法进行基准对比,验证该方法的有效性。

提出的方法

  • 将多层光学设计任务重新表述为序列生成问题,逐层生成材料和厚度。
  • 提出一种具有非重复门控机制和自回归生成的深度循环神经网络,以建模序列生成过程并提升探索效率。
  • 使用近端策略优化(PPO)训练智能体,奖励函数基于目标光学性能(如吸收率或反射率)进行设计。
  • 奖励函数鼓励在指定波长范围内实现高性能,例如在[400, 2000] nm范围内的平均吸收率或可见光增强因子。
  • 该方法应用于两个真实能源应用:具有定制光谱响应的超宽带吸收器和白炽灯滤光片。
  • 通过消融实验评估非重复门控和自回归生成对模型收敛性和性能的贡献。

实验结果

研究问题

  • RQ1深度强化学习能否在不预先知晓最优层数的情况下,有效解决多层光学设计作为序列生成问题?
  • RQ2非重复门控和自回归生成如何提升强化学习智能体在光学设计中的性能与收敛性?
  • RQ3在真实能源应用中,该方法能否发现性能优于人工专家和最先进的启发式算法的光学结构?
  • RQ4该模型在不同设计复杂度(如层数变化)下的泛化能力如何?
  • RQ5整合领域特定的结构归纳偏置(如非重复门控)是否能带来更高效的探索和更优的最终设计?

主要发现

  • OML-PPO 发现了一款五层超宽带吸收器,在400–2000 nm范围内实现了97.64%的平均吸收率,优于人工设计结构的95.37%平均吸收率。
  • 该方法还发现了一款十四层吸收器,实现了99.24%的平均吸收率,接近完美性能。
  • 在白炽灯滤光片应用中,OML-PPO 实现了16.60的可见光增强因子,比采用最先进的记忆算法设计的41层结构高出8.5%。
  • 消融实验表明,非重复门控显著提升了收敛性和最终性能,平均吸收率较无该机制的模型高出3.95%。
  • 结合非重复门控与自回归生成的模型表现最佳,10次训练运行的平均吸收率为94.98% ± 0.99%。
  • 该模型展现出良好的可扩展性和鲁棒性,在复杂、高维的设计空间中能稳定发现高性能设计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。