[논문 리뷰] Placement in Integrated Circuits using Cyclic Reinforcement Learning and Simulated Annealing
이 논문은 통합 회로 배치를 위한 순환 강화 학습(RL) 및 시뮬레이티드 어닐링(SA) 프레임워크를 제안한다. 여기서 RL은 SA의 국소 탐색을 안내하기 위해 고품질의 초기 해를 제공한다. 이 방법은 ami49 및 lattice와 같은 벤치마크에서 랜덤 초기화를 사용한 SA보다 평균 비용을 4–7% 감소시켜 더 뛰어난 배치 품질을 달성하며, 학습된 초기화와 반복적 정밀화를 통해 개선된 수렴성과 강건성을 보여준다.
Physical design and production of Integrated Circuits (IC) is becoming increasingly more challenging as the sophistication in IC technology is steadily increasing. Placement has been one of the most critical steps in IC physical design. Through decades of research, partition-based, analytical-based and annealing-based placers have been enriching the placement solution toolbox. However, open challenges including long run time and lack of ability to generalize continue to restrict wider applications of existing placement tools. We devise a learning-based placement tool based on cyclic application of Reinforcement Learning (RL) and Simulated Annealing (SA) by leveraging the advancement of RL. Results show that the RL module is able to provide a better initialization for SA and thus leads to a better final placement design. Compared to other recent learning-based placers, our method is majorly different with its combination of RL and SA. It leverages the RL model's ability to quickly get a good rough solution after training and the heuristic's ability to realize greedy improvements in the solution.
연구 동기 및 목표
- 고급 IC 설계에서 기존 플레이서의 긴 실행 시간과 낮은 확장성 문제를 해결하기 위해.
- 복잡한 제약 조건과 대규모 상태 공간을 다루는 데 어려움을 겪는 순수 히우리스틱 또는 최적화 기반 플레이서의 한계를 극복하기 위해.
- 강화 학습의 일반화 능력과 경험 학습 능력을 활용하면서도 SA의 국소 탐색 효율성과 조합하기 위해.
- RL을 통해 SA의 고급 초기 해를 생성함으로써 높은 품질의 결과에 도달하기 위한 SA 단계 수를 줄이기 위해.
- 고정 블록과 복잡한 설계 규칙 제약 조건을 포함한 다양한 IC 벤치마크에 걸쳐 일반화 능력을 향상시키기 위해.
제안 방법
- 넷리스트와 칩 레이아웃 상태를 인코딩하기 위해 커스터마이즈된 RL 환경 내에서 시퀀스 페어 표현을 사용하여 배치 문제를 모델링한다.
- 다양한 에포크 동안 강화 학습 에이전트를 훈련시어 압축된 초기 배치를 나타내는 시퀀스 페어를 생성한다.
- 각 훈련 에포크 후, RL에 의해 생성된 해를 사용해 시뮬레이티드 어닐링 단계를 위한 초기화를 수행한다.
- RL 정책 갱신과 SA 정밀화를 번갈아가며 순환하는 프로세스를 통해, RL의 전역 탐색 능력과 SA의 국소 탐색 효율성을 유기적으로 조합한다.
- 에이전트는 10–15개의 에포크 동안 훈련되며, 각 에포크당 200단계를 수행하고, 각 사이클마다 5000단계의 SA 단계를 통해 해를 정밀화한다.
- 프레임워크는 두 가지 벤치마크에서 평가된다: 고정 블록 유무에 따라 나누어진 ami49와 크기가 다양한 블록 수(100–625개)를 가진 lattice 문제.
실험 결과
연구 질문
- RQ1강화 학습 에이전트가 IC 배치에서 시뮬레이티드 어닐링의 고품질 초기 해를 효과적으로 학습하여 생성할 수 있는가?
- RQ2RL과 SA를 조합함으로써, 랜덤 초기화를 사용한 SA보다 더 빠른 수렴성과 더 나은 최종 배치 품질을 달성할 수 있는가?
- RQ3고정 블록과 복잡한 제약 조건을 포함한 다양한 크기와 구성의 벤치마크에서 RL-SA 순환 프레임워크는 어떤 성능을 보이는가?
- RQ4강화 학습 에이전트가 다양한 IC 레이아웃과 설계 유형 간에 얼마나 잘 일반화되는가?
- RQ5강화 학습 모델이 경쟁 가능한 배치 결과를 달성하기 위해 필요한 SA 단계 수를 줄일 수 있는가?
주요 결과
- 100블록 레이어 문제에서, RL 초기화는 랜덤 초기화 대비 평균 비용 3,386 µm을 기록하여 4.1% 향상되었다.
- 625블록 레이어 문제에서, 평균 비용은 RL 초기화로 인해 86,064 µm에서 85,329 µm로 감소하여 0.85% 향상되었다.
- 고정 블록이 있는 ami49 벤치마크에서, RL 초기화는 평균 비용 49 mm²를 기록했고, 랜덤 초기화 대비 53 mm²로 7.5% 감소하였다.
- 고정 블록이 없는 ami49 벤치마크에서, RL 초기화는 평균 비용 43 mm²를 기록했고, 랜덤 초기화 대비 46 mm²로 6.5% 향상되었다.
- 결과의 표준편차는 RL 초기화 시 1.41–1.46로 랜덤 초기화의 1.93–1.97보다 항상 낮아, 더 안정적이고 신뢰할 수 있는 성능을 보였다.
- 동일한 수의 SA 단계 내에서 RL-SA 프레임워크는 더 뛰어난 배치 압축성을 달성하여, RL이 국소 탐색을 위한 열등한 시작점이 아니라 보다 우수한 시작점을 제공한다는 것을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.