[논문 리뷰] On the Viability of using LLMs for SW/HW Co-Design: An Example in Designing CiM DNN Accelerators
이 논문은 소프트웨어-하드웨어(SW/HW) 공동 설계를 위한 DNN 가속기, 특히 메모리 내 연산(CiM) 아키텍처를 대상으로, 대규모 언어 모델(LLM)을 최적화 도구로 사용하는 LCDA라는 최초의 프레임워크를 제안한다. 사전 훈련된 LLM을 활용해 신경망 아키텍처 탐색에서의 '콜드 스타트' 문제를 해결함으로써, LCDA는 최신 기술 대비 25배 빠른 속도를 달성하면서도 정확도와 에너지 효율성은 유사하게 유지한다.
Deep Neural Networks (DNNs) have demonstrated impressive performance across a wide range of tasks. However, deploying DNNs on edge devices poses significant challenges due to stringent power and computational budgets. An effective solution to this issue is software-hardware (SW-HW) co-design, which allows for the tailored creation of DNN models and hardware architectures that optimally utilize available resources. However, SW-HW co-design traditionally suffers from slow optimization speeds because their optimizers do not make use of heuristic knowledge, also known as the ``cold start'' problem. In this study, we present a novel approach that leverages Large Language Models (LLMs) to address this issue. By utilizing the abundant knowledge of pre-trained LLMs in the co-design optimization process, we effectively bypass the cold start problem, substantially accelerating the design process. The proposed method achieves a significant speedup of 25x. This advancement paves the way for the rapid and efficient deployment of DNNs on edge devices.
연구 동기 및 목표
- 최적화 도구가 무작위 추측에서 시작하고 히ュ리스틱 지식이 부족한 소프트웨어-하드웨어 공동 설계의 '콜드 스타트' 문제를 해결한다.
- 사전 훈련된 LLM을 지능형 최적화 도구로 사용하여 최적의 DNN 및 하드웨어 공동 설계를 빠르게 탐색할 수 있는 가능성을 탐색한다.
- LLM이 딥 러닝 및 하드웨어 설계 분야에 넓은 지식을 바탕으로 하여 고품질의 DNN 및 CiM 가속기 설계를 효과적으로 제안할 수 있음을 입증한다.
- LLM이 CiM 가속기의 도메인 특화 제약, 예를 들어 커널 크기의 지연 및 효율성에 미치는 영향 등을 처리하는 데에 있어 상용 LLM의 한계를 규명한다.
- 향후 설명 가능한 NAS, 맞춤형으로 미세조정된 오픈소스 LLM, 자동 설계 도구 통합 연구를 위한 길을 열다.
제안 방법
- SW/HW 공동 설계를 위한 신경망 아키텍처 탐색 파이프라인에 사전 훈련된 LLM(GPT-4)을 컨트롤러로 통합한다.
- DNN 아키텍처와 해당되는 CiM 가속기 구성 설정을 생성하도록 지시하는 정교하게 설계된 프롬프트를 사용한다.
- 정확도, 지연 시간, 에너지 소비를 측정하기 위해 시뮬레이터(NeuroSIM)를 사용해 후보 설계를 평가한다.
- 검색 속도와 설계 품질 측면에서 최신 기술인 NACIM 방법과 LCDA의 성능을 비교한다.
- 업무 특화 프롬프트를 비활성화하여 도메인 인식 프롬프트의 최적화 품질에 미치는 영향을 분리 분석한다.
- 실패 사례를 분석하여 LLM이 하드웨어 활용도나 커널 크기 가정 등 도메인 특화 오해를 겪는 사례를 규명한다.
실험 결과
연구 질문
- RQ1사전 훈련된 LLM이 '콜드 스타트' 문제를 우회하면서 소프트웨어-하드웨어 공동 설계에서 효과적으로 최적화 도구로 기능할 수 있는가?
- RQ2강화 학습 또는 유전 알고리즘 기반 방법과 비교해 LLM 기반 공동 설계의 속도 및 설계 품질 측면에서의 성능은 어떠한가?
- RQ3GPT-4와 같은 일반 목적 LLM을 사용할 경우 CiM 가속기 공동 설계에서 하드웨어 특화 제약에 대해 어떤 한계가 있는가?
- RQ4업무 특화 프롬프트는 LLM이 제안하는 설계의 품질과 효율성에 어떤 영향을 미치는가?
- RQ5LLM이 생성한 설계 오류가 향후 공동 설계 프레임워크에 미치는 영향은 무엇이며, 이를 어떻게 완화할 수 있는가?
주요 결과
- LCDA는 최신 기술인 NACIM 방법 대비 최적의 DNN 및 CiM 가속기 공동 설계를 탐색하는 데 있어 25배의 속도 향상을 달성한다.
- 속도 향상에도 불구하고 LCDA의 설계 후보는 정확도-지연 시간 트레이드오���에서 NACIM을 일관되게 초월하지 못하며, 파레토 프론트의 왼쪽 상단에 유일한 이질점이 존재할 뿐이다.
- LLM의 성능은 잘못된 일반화로 인해 저하되는데, 이는 정확도 향상을 위해 커널 크기를 계속 증가시키는 경향으로 인해 장치 변동성 영향으로 인해 최적의 설계가 되지 않는 경우가 있다.
- 절단 실험 결과, 업무 특화 프롬프트 없이 LLM(LCDA-naive)를 사용할 경우 효율적인 설계를 생성하지 못함을 확인하여, 도메인 인식 프롬프트의 필요성을 입증한다.
- LLM은 하드웨어 효율성에 대한 근본적인 오해를 보이며, 5x5 커널 크기는 크로스바 활용도를 낮추고 지연 시간을 증가시킬 수 있음을 이해하지 못함을 확인한다.
- 이 연구는 상용 모델이 CiM 가속기 공동 설계 최적화에 필요한 지식을 갖추지 못하고 있음을 시사하며, 도메인 특화 데이터에 대해 LLM을 미세조정할 필요성이 있음을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.