Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Pareto Frontier for Performance Evaluation of Deep Neural Networks

Vahid Partovi Nia, Alireza Ghaffari|arXiv (Cornell University)|2022. 02. 18.
Machine Learning and Data Classification인용 수 4
한 줄 요약

이 논문은 정확도, 인퍼런스 지연(클라우드 및 엣지 하드웨어에서의 지연), 훈련 비용을 동시에 최적화하여 딥 뉴럴 네트워크를 객관적으로 평가하기 위해 확률적 다차원 파레토 경계를 제안한다. 매개변수 기반 부트스트래핑을 통해 랜덤 변동성을 통합함으로써, 다양한 하드웨어에서 모델의 견고한 순위를 매길 수 있으며, 성능 변동성에도 불구하고 MobileNetV3와 SqueezeNetV1.1이 일관되게 효율성에서 우월함을 드러낸다.

ABSTRACT

Performance optimization of deep learning models is conducted either manually or through automatic architecture search, or a combination of both. On the other hand, their performance strongly depends on the target hardware and how successfully the models were trained. We propose to use a multi-dimensional Pareto frontier to re-define the efficiency measure of candidate deep learning models, where several variables such as training cost, inference latency, and accuracy play a relative role in defining a dominant model. Furthermore, a random version of the multi-dimensional Pareto frontier is introduced to mitigate the uncertainty of accuracy, latency, and throughput of deep learning models in different experimental setups. These two complementary methods can be combined to perform objective benchmarking of deep learning models. Our proposed method is applied to a wide range of deep image classification models trained on ImageNet data. Our method combines competing variables with stochastic nature in a single relative efficiency measure. This allows ranking deep learning models that run efficiently on different hardware, and combining inference efficiency with training efficiency objectively.

연구 동기 및 목표

  • 정확도, 인퍼런스 효율성, 훈련 효율성을 동시에 고려하는 객관적이고 다차원적인 벤치마킹의 부재를 해결하기 위해.
  • 확률적 훈련과 하드웨어 특화 지연으로 인한 성능 변동성을 줄이기 위해, 확률적 파레토 경계를 도입함으로써 문제를 완화하기 위해.
  • 정확도, 다양한 하드웨어 플랫폼에서의 지연, 훈련 비용이라는 경쟁적 지표들을 하나의 상대적 효율성 측도로 통합하여 모델 비교를 가능하게 하기 위해.
  • 다양한 하드웨어 타겟에서 객관적인 모델 선택을 가능하게 하기 위해, 모델 간의 확률적 지배 관계를 정의하기 위해.

제안 방법

  • 상위-1 정확도, NVIDIA V100 인퍼런스 지연, ARM Kirin 970 엣지 지연, 그리고 달러 단위의 훈련 비용을 포함한 세 가지 핵심 목표를 반영하는 다차원 파레토 경계를 제안한다.
  • 정확도, 지연, 훈련 비용의 랜덤 변동성을 모델링하기 위해 5회 실험 주기 동안 매개변수 기반 부트스트래핑을 사용하는 확률적 파레토 경계를 도입한다.
  • 모델의 모든 목표에서의 지배력을 반영하는 정규화된 점수인 상대적 효율성 측도 θ̂를 정의하여, 모델 간 비교를 가능하게 한다.
  • 확률적 지배를 활용해 모델 순위를 매기며, A에서 B로의 화살표는 불확실성 하에서 모든 목표에서 A가 B를 지배함을 나타낸다.
  • ImageNet-1K에서 훈련된 모델의 실측 측정치를 사용하여 효율성 분포를 계산하고, 성능 변동성을 시각화하기 위해 박스플롯을 생성한다.
  • MobileNet, ResNet, DenseNet, MNASNet 등 다양한 이미지 분류 모델을 여러 하드웨어 플랫폼에서 적용하여 분석한다.

실험 결과

연구 질문

  • RQ1다양한 하드웨어 플랫폼에서 정확도, 인퍼런스 지연, 훈련 비용 간의 상호 보완적 특성에 기인한 딥 뉴럴 네트워크 모델을 객관적으로 비교하는 방법은 무엇인가?
  • RQ2정확도, 지연, 훈련 비용의 랜덤 변동성이 모델 순위의 신뢰성에 어느 정도 영향을 미치는가?
  • RQ3다차원 효율성 지표를 사용할 경우, 다양한 하드웨어 및 훈련 조건에서 일관되게 우월한 성능을 보이는 딥 뉴럴 네트워크 모델은 무엇인가?
  • RQ4확률적 파레토 경계는 딥 뉴럴 네트워크 모델 평가에서 성능 불확실성을 효과적으로 포착하고 완화할 수 있는가?

주요 결과

  • MobileNetV3와 SqueezeNetV1.1는 좁은 박스플롯 분포를 보이며 가장 높은 상대적 효율성을 확보하여, 여러 실험 주기와 하드웨어 플랫폼에서 견고한 성능을 보였다.
  • ShuffleNetV2와 MobileNetV3는 강력한 확률적 지배를 보이며, 성능 변동성에도 불구하고 항상 효율적이었고, 효율성 점수가 일관되게 100% 수준을 유지했다.
  • DualPathNet92는 가장 열 劣한 성능을 보였으며, 효율성 분포가 20% 이하에 머물러 있어 낮은 내구성과 지배력 부족을 나타냈다.
  • 훈련 비용을 포함함으로써 모델 순위가 크게 변화했다: 지연 시간 기준으로는 MobileNetV3가 선두였지만, 훈련 비용을 고려하면 ShuffleNetV2가 더 효율적인 것으로 나타났다.
  • 그림 3(b)의 확률적 지배도는 MobileNetV3와 SqueezeNetV1.1이 불확실성 하에서도 모든 목표에서 다른 모든 모델을 지배함을 확인한다.
  • 이 방법은 이전에 간과되었던 훈련 비용을 통합함으로써 효율성의 정의를 재구성하였으며, DNN에 대한 통합적이고 객관적인 벤치마킹 프레임워크를 성공적으로 구축했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.