Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Multitask Learning on Resource-Constrained Systems

Yubo Luo, Le Zhang|arXiv (Cornell University)|2023. 02. 25.
Advanced Neural Network Applications인용 수 7
한 줄 요약

Antler는 자원이 제한된 장치에서 다중 작업 추론을 최적화하기 위해 작업 간 친화도와 의존성을 활용하여 컴act한 작업 그래프를 구성하고 최적의 실행 순서를 결정하는 새로운 시스템이다. 공유되는 부분 작업을 재사용하고 컨텍스트 스위치를 최소화함으로써, 최신 기술 대비 추론 시간을 2.3배에서 4.6배 감소시키고 에너지 소비를 56%에서 78% 감소시킨다.

ABSTRACT

We present Antler, which exploits the affinity between all pairs of tasks in a multitask inference system to construct a compact graph representation of the task set and finds an optimal order of execution of the tasks such that the end-to-end time and energy cost of inference is reduced while the accuracy remains similar to the state-of-the-art. The design of Antler is based on two observations: first, tasks running on the same platform shows affinity, which is leveraged to find a compact graph representation of the tasks that helps avoid unnecessary computations of overlapping subtasks in the task set; and second, tasks that run on the same system may have dependencies, which is leveraged to find an optimal ordering of the tasks that helps avoid unnecessary computations of the dependent tasks or the remaining portion of a task. We implement two systems: a 16-bit TI MSP430FR5994-based custom-designed ultra-low-power system, and a 32-bit ARM Cortex M4/M7-based off-the-shelf STM32H747 board. We conduct both dataset-driven experiments as well as real-world deployments with these systems. We observe that Antler's execution time and energy consumption are the lowest compared to all baseline systems and by leveraging the similarity of tasks and by reusing the intermediate results from previous task, Antler reduces the inference time by 2.3X -- 4.6X and saves 56\% -- 78\% energy, when compared to the state-of-the-art.

연구 동기 및 목표

  • 자원이 제한된 임베디드 시스템에서 다중 학습의 높은 추론 시간과 에너지 비용을 해결하기 위해.
  • 관련된 추론 작업 간 공유되는 부분 작업인 작업 친화도를 활용하여 중복 계산을 제거하기 위해.
  • 불필요한 부분 작업 실행을 방지하기 위해 상호 작업 간 및 내부 작업 간 의존성을 모델링하고 강제 적용하기 위해.
  • 모델 정확도를 유지하면서 종단 간 추론 시간과 에너지 소비를 최소화하기 위해.
  • 최적의 작업 순서가 NP-완전임을 엄밀히 증명하고 정수 프로그래밍 및 유전 알고리즘을 활용한 확장 가능한 해법을 제공하기 위해.

제안 방법

  • 작업 간 쌍별 친화도를 기반으로 다중 작업 시스템의 컴act한 그래프 표현을 구성하여 작업 간 공통되는 구조를 포착한다.
  • 작업 간 전환 오버헤드를 고려한 스위칭 비용 함수를 사용하여 작업 실행 비용을 모델링한다.
  • 선순서 및 의존성 제약 조건 하에 최적의 작업 순서 문제를 해결하기 위해 정수 선형 프로그래밍(ILP)을 사용한다.
  • 브루트 포스 ILP가 비현실적인 대규모 작업 집합에 대해 확장 가능하도록, 유전 알고리즘을 활용하여 해를 확장한다.
  • 재정렬 및 부분 작업 공유 후 정확도를 유지하기 위해 작업 그래프를 재학습시킨다.
  • 16비트 TI MSP430FR5994 및 32비트 ARM Cortex-M4/M7 STM32H747 두 가지 초저전력 플랫폼에서 접근 방식을 검증한다.

실험 결과

연구 질문

  • RQ1자원이 제한된 임베디드 시스템에서 다수의 추론 작업 간 친화도를 활용하여 다중 학습의 중복 계산을 줄일 수 있는가?
  • RQ2다중 작업 시스템에서 종단 간 추론 시간과 에너지 소비를 최소화하기 위해 작업 순서를 어떻게 최적화할 수 있는가?
  • RQ3다중 학습에서 최적의 작업 순서 문제의 계산 복잡도는 무엇이며, 이를 효율적으로 해결할 수 있는가?
  • RQ4유전 알고리즘이 작업 의존성을 고려하면서도 오버헤드를 최소화하면서 대규모 작업 집합에 효과적으로 확장 가능한가?
  • RQ5공유되는 부분 작업과 최적의 순서는 정확도를 떨어뜨리지 않으면서 얼마나 추론 시간과 에너지 소비를 줄일 수 있는가?

주요 결과

  • Antler는 자원이 제한된 플랫폼에서 최신 기술 대비 다중 학습 시스템의 추론 시간을 2.3배에서 4.6배 감소시켰다.
  • 부분 작업 재사용과 최적의 작업 순서로 인해 에너지 소비가 56%에서 78% 감소했다.
  • 최적의 작업 순서 문제의 NP-완전성은 엄밀히 증명되었으며, 이는 휴리스틱 및 ILP 기반 해법의 필요성을 정당화한다.
  • 유전 알고리즘 솔버는 근사 최적 성능을 달성하고 대규모 작업 집합으로의 확장성도 효과적으로 확보했다.
  • 계산 및 에너지 오버헤드를 크게 줄였음에도 불구하고, 상태의 최신 모델과 유사한 정확도를 유지했다.
  • MSP430 및 STM32H747 플랫폼에 대한 실제 구현을 통해 다양한 워크로드에서 일관된 성능 향상이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.