Skip to main content
QUICK REVIEW

[논문 리뷰] AI on the Edge: Rethinking AI-based IoT Applications Using Specialized Edge Architectures

Qianlin Liang, Prashant Shenoy|arXiv (Cornell University)|2020. 03. 27.
IoT and Edge/Fog Computing참고 문헌 25인용 수 14
한 줄 요약

이 논문은 IoT 시스템 내 AI 워크로드를 위한 전용 엣지 가속기—Google Edge TPU, Intel Movidius VPU, NVIDIA Jetson—을 평가한다. 실험적 평가를 통해 이러한 가속기가 전통적인 엣지 및 클라우드 서버보다 성능 대 전력 소비 비율과 성능 대 비용 비율에서 뛰어나며, 모델 분할 및 압축을 통해 지연 시간과 대역폭 절감 효과를 낼 수 있음을 보여주지만, 다중 테넌트 엣지 클라우드 환경 구현에 있어 격리 기능이 부족함을 밝힌다.

ABSTRACT

Edge computing has emerged as a popular paradigm for supporting mobile and IoT applications with low latency or high bandwidth needs. The attractiveness of edge computing has been further enhanced due to the recent availability of special-purpose hardware to accelerate specific compute tasks, such as deep learning inference, on edge nodes. In this paper, we experimentally compare the benefits and limitations of using specialized edge systems, built using edge accelerators, to more traditional forms of edge and cloud computing. Our experimental study using edge-based AI workloads shows that today's edge accelerators can provide comparable, and in many cases better, performance, when normalized for power or cost, than traditional edge and cloud servers. They also provide latency and bandwidth benefits for split processing, across and within tiers, when using model compression or model splitting, but require dynamic methods to determine the optimal split across tiers. We find that edge accelerators can support varying degrees of concurrency for multi-tenant inference applications, but lack isolation mechanisms necessary for edge cloud multi-tenant hosting.

연구 동기 및 목표

  • 전용 엣지 가속기의 성능, 에너지 효율성, 비용 효율성을 기존 엣지 및 클라우드 컴퓨팅과 비교하여 AI 워크로드에 대해 평가하는 것.
  • 모델 압축 및 모델 분할을 활용한 분할 처리가 장치-엣지-클라우드 계층 간 지연 시간과 대역폭을 어떻게 최적화할 수 있는지 조사하는 것.
  • 엣지 클라우드 환경에서 동시 다중 테넌트 추론 워크로드를 지원하는 데 있어 엣지 가속기의 적합성을 평가하는 것.
  • 특히 메모리, 동시성, 격리와 같은 시스템 수준의 트레이드오프와 제약 사항을 특정하여 실세계 IoT 응용 프로그램에 엣지 가속기를 구현할 때의 한계를 밝히는 것.

제안 방법

  • Intel Movidius VPU, Google Edge TPU, NVIDIA Jetson Nano, TX2를 포함한 여러 엣지 가속기를 사용해 실험적 테스트베드를 구축하였다.
  • 시각 및 음성 처리를 포함한 다양한 AI 추론 워크로드에서 성능, 전력 소비, 비용을 측정하였다.
  • 장치-엣지, 엣지-엣지, 엣지-클라우드 계층 간의 모델 압축 및 모델 분할 전략을 구현하고 평가하였다.
  • 동시 실행 중인 여러 모델을 통해 동시성 지원을 분석하고, 모델 스위핑 및 양자화와 같은 런타임 최적화 기법을 분석하였다.
  • 공유 하드웨어에서 동시 실행 중인 모델 간 간섭 현상을 관찰하여 격리 및 보안 제약 사항을 평가하였다.
  • 엣지 가속기를 일반 목적의 엣지 및 클라우드 서버와 비교하기 위해 정규화된 지표(성능 대 전력 소비 비율, 성능 대 비용 비율)를 사용하였다.

실험 결과

연구 질문

  • RQ1AI 추론 워크로드에 대해 전용 엣지 가속기는 기존 엣지 및 클라우드 서버와 비교해 성능, 전력 효율성, 비용 측면에서 어떻게 비교되는가?
  • RQ2장치-엣지, 엣지-엣지, 엣지-클라우드 계층 간의 모델 압축 및 모델 분할을 사용할 경우, 엣지 AI 시스템에서 지연 시간과 대역폭에 어떤 이점이 있는가?
  • RQ3엣지 가속기는 동시 다중 테넌트 추론 워크로드를 어느 정도 지원할 수 있으며, 메모리 및 격리 측면에서의 제약 사항은 무엇인가?
  • RQ4메모리 크기, 모델 양자화, 런타임 최적화와 같은 시스템 수준의 요소가 엣지 가속기에서 동시성과 성능에 어떻게 영향을 미치는가?

주요 결과

  • 엣지 가속기는 일반 목적의 엣지 서버 대비 성능 대 전력 소비 비율과 성능 대 비용 비율에서 최대 10–100배 향상된다.
  • 계층 간의 모델 분할 및 압축은 대역폭 사용량과 지연 시간을 감소시키지만, 그 효과는 모델 아키텍처와 분할 전략에 따라 크게 달라진다.
  • 메모리가 제한된 장치는 런타임 최적화 기법(예: 모델 스위핑, 양자화)을 통해 높은 동시성을 지원할 수 있지만, 프레임워크가 메모리 최적화되어 있어야 가능하다.
  • 엣지 가속기는 하드웨어 및 소프트웨어 제약 조건에 따라 다양한 수준의 동시성을 지원하지만, 동시 실행 중인 모델 간 격리 메커니즘이 부족하다.
  • 다중 테넌시 엣지 클라우드 환경에서 사용 가능한 엣지 가속기의 실현 가능성을 제한하는 요소는 테넌트 간 하드웨어 또는 소프트웨어 격리 기능의 부재이다.
  • 모델 분할의 최적 분할 지점은 모델과 워크로드에 따라 크게 달라지며, 최대 효과를 얻기 위해서는 동적이고 워크로드 인식 기반의 의사결정이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.