[论文解读] Circuit Routing Using Monte Carlo Tree Search and Deep Neural Networks
本文提出一种基于深度神经网络(DNN)引导的蒙特卡洛树搜索(MCTS)的端到端电路布线方法,将布线建模为序列决策问题。通过结合DNN引导的深度优先搜索(DFS)回溯与基于最大奖励的UCT选择策略,该方法在复杂且此前无法求解的单层电路中,实现了比原始MCTS或基线算法更高的成功率和更低的线长冗余。
Circuit routing is a fundamental problem in designing electronic systems such as integrated circuits (ICs) and printed circuit boards (PCBs) which form the hardware of electronics and computers. Like finding paths between pairs of locations, circuit routing generates traces of wires to connect contacts or leads of circuit components. It is challenging because finding paths between dense and massive electronic components involves a very large search space. Existing solutions are either manually designed with domain knowledge or tailored to specific design rules, hence, difficult to adapt to new problems or design needs. Therefore, a general routing approach is highly desired. In this paper, we model the circuit routing as a sequential decision-making problem, and solve it by Monte Carlo tree search (MCTS) with deep neural network (DNN) guided rollout. It could be easily extended to routing cases with more routing constraints and optimization goals. Experiments on randomly generated single-layer circuits show the potential to route complex circuits. The proposed approach can solve the problems that benchmark methods such as sequential A* method and Lee's algorithm cannot solve, and can also outperform the vanilla MCTS approach.
研究动机与目标
- 解决随设计规则演进而难以适应和维护的手动设计启发式布线算法的局限性。
- 开发一种不依赖领域特定启发式规则或人工调优的通用布线框架。
- 通过在已布线电路上进行训练,实现布线策略的自动学习,减少对专家知识的依赖。
- 利用深度强化学习增强的MCTS,提升大规模布线问题中的搜索效率与解的质量。
- 构建一个灵活可扩展的布线系统,仅通过修改奖励函数即可调整设计约束与优化目标,而无需修改核心代码。
提出的方法
- 将电路布线建模为序列决策过程,其中每个动作在网格图上添加一个顶点或边,类似于在围棋中落子。
- 采用基于最大奖励的上限置信区间树(Max-UCT)的蒙特卡洛树搜索(MCTS),优先选择具有更高布线成功率潜力的节点。
- 使用卷积神经网络(CNN)预测高质量的布线动作,引导回溯策略并缩小搜索空间。
- 将DNN驱动的动作预测与深度优先搜索(DFS)结合作为回溯策略,在模拟过程中高效探索有希望的路径。
- 引入一种区分成功与失败布线的奖励函数,使算法能够从两种结果中学习。
- 在不同布线任务间保留并重用搜索知识,尽管当前实现尚未支持跨状态知识迁移。
实验结果
研究问题
- RQ1深度神经网络能否在不依赖手工设计启发式规则的情况下,有效引导MCTS求解复杂电路布线问题?
- RQ2与基于平均奖励的UCT相比,使用基于最大奖励的UCT选择是否能提升布线成功率与解的质量?
- RQ3所提出的MCTS-DNN框架能否成功布线标准算法(如A*或Lee算法)无法求解的电路?
- RQ4DNN引导的回溯策略对搜索效率与线长优化有何影响?
- RQ5该框架在不改变架构的前提下,能否扩展至多层设计或其他布线约束?
主要发现
- 在1,000次迭代后,所提出的DNN引导回溯的MCTS方法在复杂单层电路中实现了100%的成功率,优于完全失败的基线方法。
- 在5,000次迭代下,该方法将线长冗余比降低至4.5%,显著低于使用平均奖励UCT的原始MCTS的76.7%的平均水平。
- Max-UCT变体在线长冗余上表现出随迭代次数单调下降的趋势,而Avg-UCT变体则无此趋势,表明其具有更好的收敛性与优化能力。
- DNN-DFS回溯策略在500次迭代时实现了93.33%的平均成功率,在1,000次迭代时达到100%,证明了其出色的可扩展性与引导质量。
- 该方法成功布线了A*与Lee算法无法求解的电路,证明其在高难度实例上的强大能力。
- 该框架具有高度可适配性:仅需修改奖励函数即可调整设计规则或优化目标,而无需更改算法或代码库。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。