Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-DNN Accelerators for Next-Generation AI Systems

Stylianos I. Venieris, Christos-Savvas Bouganis|arXiv (Cornell University)|2022. 05. 19.
Advanced Neural Network Applications인용 수 6
한 줄 요약

이 논문은 차세대 AI 시스템의 증가하는 요구를 충족하기 위해 단일 DNN에서 다중 DNN 가속기 아키텍처 설계로의 범주 전환을 제안한다. 공동 설계 방법론, 다중 DNN 근사 계산, 최적화된 스케줄링을 도입하여 다양한 DNN 워크로드에서 개별 지연 시간 제약을 충족하면서도 최대 처리량을 달성한다.

ABSTRACT

As the use of AI-powered applications widens across multiple domains, so do increase the computational demands. Primary driver of AI technology are the deep neural networks (DNNs). When focusing either on cloud-based systems that serve multiple AI queries from different users each with their own DNN model, or on mobile robots and smartphones employing pipelines of various models or parallel DNNs for the concurrent processing of multi-modal data, the next generation of AI systems will have multi-DNN workloads at their core. Large-scale deployment of AI services and integration across mobile and embedded systems require additional breakthroughs in the computer architecture front, with processors that can maintain high performance as the number of DNNs increases while meeting the quality-of-service requirements, giving rise to the topic of multi-DNN accelerator design.

연구 동기 및 목표

  • 클라우드, 모바일, 임베디드 AI 시스템에서 다수의 DNN를 고성능, 저에너지 효율적으로 처리할 수 있는 요구 증가에 대응.
  • 다양한 계산 및 메모리 요구 사항을 가진 다중 DNN 워크로드에 적합하지 않은 단일 DNN 가속기의 한계를 극복.
  • 개별 지연 시간 및 처리량 제약을 충족하면서 파이프라인, 병렬, 연결된 DNN 워크로드를 모두 지원하는 가속기 설계.
  • 진화하는 DNN 아키텍처와 워크로드를 지원하기 위해 하드웨어 맞춤화와 유연성의 균형을 유지.
  • 모델-하드웨어 공동 설계 및 다중 DNN 간 근사 계산 기법을 통해 확장 가능하고 효율적인 다중 DNN 가속화를 구현.

제안 방법

  • 다중 DNN 워크로드에 맞춘 상호 DNN 병렬화 및 적응형 스케줄링 정책을 중심으로 하는 새로운 아키텍처 패러다임 제안.
  • 공유된 저랭크 가중치 표현과 가변 정밀도를 활용해 자원 사용량을 줄이고 정확도 손실를 통제하는 다중 DNN 근사 계산 도입.
  • 검색 기반 최적화(예: ASICNAS)를 활용한 모델-하드웨어 공동 설계를 통해 DNN 아키텍처, 스케줄링, 하드웨어 파rameter를 동시에 탐색.
  • 계산 대 통신 비율, 메모리 면적, 근사 계산에 대한 내성 등 DNN 간 차이를 고려한 워크로드 인식 자원 할당 적용.
  • 파이프라인 및 병렬 DNN를 위한 공동 스케줄링 메커니즘 개발로 공백 시간을 최소화하고 처리량을 극대화.
  • 다양한 AI 응용 프로그램에서의 사용 용이성을 확보하기 위해 소프트웨어 지원 및 추상화 계층 통합.

실험 결과

연구 질문

  • RQ1메모리, 계산, 정밀도 요구 사항이 다양한 DNN 워크로드를 효율적으로 처리할 수 있도록 다중 DNN 가속기를 어떻게 아키텍처화할 수 있는가?
  • RQ2단일 DNN의 처리량과 지연 시간을 초월해 다중 DNN 시스템의 핵심 성능 지표와 설계 상충 관계는 무엇인가?
  • RQ3다중 DNN 간 부족함과 근사 계산에 대한 다양한 내성은 에너지 효율성과 면적 활용도 향상에 어떻게 활용될 수 있는가?
  • RQ4다수의 DNN와 하드웨어 구성의 고차원 설계 공간을 효과적으로 탐색할 수 있는 확장 가능한 공동 설계 방법론은 무엇인가?
  • RQ5스케줄링 및 상호 DNN 병렬화가 개별 DNN 지연 시간 제약을 충족하면서도 통합 처리량을 극대화하는 데 어떤 역할을 하는가?

주요 결과

  • 다중 DNN 가속기는 단일 DNN 최적화에서 벗어나 상호 DNN 병렬화, 스케줄링, 다중 DNN 자원 공유에 초점을 맞춰야 고처리량과 저지연을 달성할 수 있다.
  • 공유된 저랭크 가중치 표현과 같은 다중 DNN 근사 계산은 통제된 정확도 저하로도 뚜렷한 하드웨어 효율성 향상을 이끌 수 있다.
  • ASICNAS를 예로 들 수 있는 모델-하드웨어 공동 설계 기법은 다중 DNN 워크로드에서 최대 2배의 에너지 절감을 달성하며 정확도 저하가 1.6퍼센트 포인트 이내이다.
  • 다중 DNN 가속기의 설계 공간은 다수의 DNN와 그 상호 의존성, 다양성 등으로 인해 단일 DNN 시스템보다 훨씬 더 복잡하다.
  • 미래의 가속기는 맞춤화와 유연성의 균형을 유지하고 강력한 소프트웨어 지원을 포함하여 다양한 AI 응용 프로그램에서 널리 사용될 수 있도록 해야 한다.
  • 근사 계산과 공동 설계는 차세대 다중 DNN 시스템에서 고성능과 에너지 효율성을 달성하는 데 핵심적인 요소이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.