[论文解读] On Joint Learning for Solving Placement and Routing in Chip Design
本文提出 DeepPlace 用于端到端的宏单元/标准单元放置,以及 DeepPR 用于通过强化学习进行联合放置与布线,采用多视图嵌入和随机网络蒸馏,在 ISPD-2005 基准上显示出改进的线长和更快的训练。
For its advantage in GPU acceleration and less dependency on human experts, machine learning has been an emerging tool for solving the placement and routing problems, as two critical steps in modern chip design flow. Being still in its early stage, there are fundamental issues: scalability, reward design, and end-to-end learning paradigm etc. To achieve end-to-end placement learning, we first propose a joint learning method termed by DeepPlace for the placement of macros and standard cells, by the integration of reinforcement learning with a gradient based optimization scheme. To further bridge the placement with the subsequent routing task, we also develop a joint learning approach via reinforcement learning to fulfill both macro placement and routing, which is called DeepPR. One key design in our (reinforcement) learning paradigm involves a multi-view embedding model to encode both global graph level and local node level information of the input macros. Moreover, the random network distillation is devised to encourage exploration. Experiments on public chip design benchmarks show that our method can effectively learn from experience and also provides intermediate placement for the post standard cell placement, within few hours for training.
研究动机与目标
- 动机并解决基于机器学习的放置与布线在可扩展性、奖励设计和端到端学习方面的不足。
- 提出一种端到端的 DeepPlace 方法,通过强化学习和基于梯度的优化,对宏单元和标准单元进行顺序放置。
- 开发 DeepPR,通过强化学习联合学习放置和布线。
- 引入多视图嵌入(CNN+GNN)用于状态表示,并通过随机网络蒸馏增强探索。
提出的方法
- 将放置建模为一个强化学习问题,离散动作空间在 n x n 芯片画布的网格位置上。
- 使用一个策略网络,将全局基于 CNN 的布局嵌入与局部基于 GNN 的网表嵌入融合,以预测宏放置操作。
- 将宏放置的强化学习与基于梯度的放置器(DREAMPlace)结合,用于标准单元放置,以获得完整的放置解。
- 通过训练用于放置的 RL 代理并在布线阶段使用最终线长反馈作为奖励,扩展为联合放置与布线(DeepPR)。
- 结合随机网络蒸馏以在放置期间提供内在奖励以促进探索。
- 使用基于 PPO 的训练、HPWL 作为线长的 RPC 代理,以及基于 RUDY 的拥塞指标进行评估;可选择使用单独的路由器或基于 RL 的路由器进行布线。
实验结果
研究问题
- RQ1端到端学习是否相较于顺序放置或解析放置器能提升宏单元和标准单元的放置?
- RQ2通过强化学习的联合放置与布线是否比单独的放置-布线流程得到更好的最终线长?
- RQ3多视图嵌入(CNN+GNN)结合内在探索奖励(RND)是否提高芯片放置的学习效率和解的质量?
- RQ4将梯度基的标准单元放置器与对宏单元的 RL 集成如何影响运行时和可扩展性?
- RQ5在扩展到更大量的宏单元和更复杂的设计时有哪些权衡和局限?
主要发现
- DeepPlace(宏+标准单元放置)在线长方面优于顺序放置方法,并在 ISPD-2005 电路中显示出一致的改进。
- DeepPR(联合放置与布线)在考虑布线的线长方面显著优于独立流水线,表明端到端优化的好处。
- 多视图策略网络(CNN+GNN)结合 RND 内在奖励,在探索和最终奖励方面显著优于基线。
- DeepPlace 在宏放置运行时间上相对于 RePlace 在八个 ISPD-2005 电路上大约提升 4 倍。
- 在仅宏网上的预训练可以加速收敛并在扩展到完整放置与布线任务时稳定学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。