[논문 리뷰] EDD: Efficient Differentiable DNN Architecture and Implementation Co-search for Embedded AI Solutions
이 논문은 딥 뉴럴 네트워크(DNN) 아키텍처와 하드웨어 구현을 동시에 최적화하기 위한 유연하고 통합된 검색 프레임워크인 EDD를 제안한다. DNN 검색 변수와 하드웨어 파라미터를 통합된 유연한 공간으로 융합함으로써 EDD는 기울기 기반 최적화를 가능하게 하여 최신 기술 수준의 성능을 달성한다: 기존 NAS 방법과 비교해 GPU에서 1.40배 빠른 추론 속도와 FPGA에서 1.45배 높은 처리량을 달성한다.
High quality AI solutions require joint optimization of AI algorithms and their hardware implementations. In this work, we are the first to propose a fully simultaneous, efficient differentiable DNN architecture and implementation co-search (EDD) methodology. We formulate the co-search problem by fusing DNN search variables and hardware implementation variables into one solution space, and maximize both algorithm accuracy and hardware implementation quality. The formulation is differentiable with respect to the fused variables, so that gradient descent algorithm can be applied to greatly reduce the search time. The formulation is also applicable for various devices with different objectives. In the experiments, we demonstrate the effectiveness of our EDD methodology by searching for three representative DNNs, targeting low-latency GPU implementation and FPGA implementations with both recursive and pipelined architectures. Each model produced by EDD achieves similar accuracy as the best existing DNN models searched by neural architecture search (NAS) methods on ImageNet, but with superior performance obtained within 12 GPU-hour searches. Our DNN targeting GPU is 1.40x faster than the state-of-the-art solution reported in Proxyless, and our DNN targeting FPGA delivers 1.45x higher throughput than the state-of-the-art solution reported in DNNBuilder.
연구 동기 및 목표
- 기존 NAS 방법이 검색 중 하드웨어 구현을 고정되거나 추정된 구성 요소로 간주하는 격차를 해결한다.
- 다양한 플랫폼에서 DNN 정확도와 하드웨어 성능(지연, 처리량, 에너지 소비)을 동시에 최적화할 수 있도록 한다.
- DNN 아키텍처와 구현 변수를 하나의 검색 공간으로 통합하는 통합적이고 유연한 수식을 개발한다.
- 낮은 지연 시간을 가진 GPU 및 FPGA 가속기 대상으로 최소한의 검색 비용으로 고성능 AI 솔루션을 달성한다.
- GPU, 재귀적 구조, 파이ipel라인화된 FPGA 아키텍처를 포함한 다양한 하드웨어 플랫폼에서의 일반화 능력을 입증한다.
제안 방법
- DNN 아키텍처 변수(예: 필터 크기, 채널 확장)와 하드웨어 구현 변수(예: 정밀도, 타일링, 파이ipel라인화)를 하나의 통합된 솔루션 공간으로 융합하여 공동 검색 문제를 수립한다.
- DNN 정확도(교차 엔트로피 손실을 통해)와 하드웨어 성능(지연/처리량 손실을 통해)을 동시에 최적화하는 복합 목표 함수를 정의하며, 이는 모두 유연한 구성 요소를 포함한다.
- Gumbel-Softmax나 유연한 아키텍처 가중치와 같은 유연한 연산을 사용하여 융합된 검색 공간에서 기울기 기반 최적화를 가능하게 한다.
- 확률적 경사 하강법(SGD)을 사용하여 DNN 아키텍처 및 구현 파라미터를 동시에 업데이트함으로써 효율적이고 종단 간 훈련을 가능하게 한다.
- 다양한 정밀도 형식(예: 4-, 8-, 16-, 32비트)과 하드웨어 특화 최적화(예: 커널 융합, 루프 타일링, 자원 공유)를 유연한 프레임워크 내에서 지원한다.
- 검색 과정이 12 GPU 시간 이내에 완료되도록 GPU(저지연), 재귀적 FPGA, 파이ipel라인화된 FPGA 세 플랫폼에서 방법을 검증한다.
실험 결과
연구 질문
- RQ1완전히 유연한 공동 검색 프레임워크는 DNN 아키텍처와 하드웨어 구현을 동시에 최적화하여 정확도와 성능을 향상시킬 수 있는가?
- RQ2DNN 아키텍처와 하드웨어 구현을 공동으로 검색할 경우, 별도의 NAS 및 구현 플로우 대비 추론 지연 시간과 처리량에 어떤 영향을 미치는가?
- RQ3제안된 유연한 수식은 GPU와 FPGAs 등 서로 다른 아키텍처 제약을 가진 다양한 하드웨어 플랫폼으로 얼마나 잘 일반화되는가?
- RQ4이 방법은 최신 기술 수준의 NAS 모델과 유사한 정확도를 달성하면서도 하드웨어 효율성에서 크게 뛰어난 DNN을 발견할 수 있는가?
- RQ5검색 공간에 하드웨어 인식 제약(예: 정밀도, 자원 공유, 파이ipel라인화)을 포함할 경우 최종 모델의 성능과 효율성에 어떤 영향을 미치는가?
주요 결과
- GPU를 대상으로 한 EDD-Net-1은 Titan RTX에서 11.17ms의 추론 지연을 기록하여 Proxyless-GPU 모델 대비 1.40배 더 빠른 성능을 달성한다.
- 1080 Ti GPU에서 EDD-Net-1은 MNasNet 대비 1.6배, FBNet-C 대비 2.0배 빠른 지연 시간을 유지하면서도 높은 정확도를 확보한다.
- 재귀적 FPGA 가속기 대상인 EDD-Net-2는 Xilinx ZCU102에서 7.96ms의 지연 시간을 기록하여 ProxylessNet(1.37배 빠름), FBNet(1.53배 빠름), MNasNet(1.1배 빠름)을 모두 앞선다.
- ZC706에서 900개의 DSP를 사용하는 파이ipel라인화된 FPGA 가속기 대상인 EDD-Net-3은 16비트 고정소수점 정밀도 하에서 DNNBuilder 기준 1.45배 높은 처리량을 제공한다.
- 모든 EDD 모델는 최신 기술 수준의 NAS 모델과 유사한 ImageNet top-1 정확도를 확보하면서도 하드웨어 효율성에서 뚜렷한 향상을 이룬다.
- 전체 공동 검색 과정은 12 GPU 시간 이내에 완료되어 기존의 NAS 및 구현 워크플로우에 비해 매우 높은 효율성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.