Skip to main content
QUICK REVIEW

[논문 리뷰] An Orchestrated Empirical Study on Deep Learning Frameworks and Platforms

Qianyu Guo, Xiaofei Xie|arXiv (Cornell University)|2018. 11. 13.
Advanced Neural Network Applications참고 문헌 37인용 수 5
한 줄 요약

이 논문은 MNIST 및 CIFAR-10 데이터셋을 사용하여 서버, 웹, 모바일 플랫폼에서 Tensorflow, Theano, Torch를 종합적으로 비교한 실증 연구를 제시한다. 연구 결과, 프레임워크 및 플랫폼 간에 성능, 정확도, 내구성 측면에서 뚜렷한 차이가 있음을 확인하였으며, 이는 중요한 호환성 문제를 드러내고, 향후 교차 프레임워크 및 교차 플랫폼 딥러닝 시스템 개발을 가능하게 하는 공개된 도구 체인을 제안한다.

ABSTRACT

Deep learning (DL) has recently achieved tremendous success in a variety of cutting-edge applications, e.g., image recognition, speech and natural language processing, and autonomous driving. Besides the available big data and hardware evolution, DL frameworks and platforms play a key role to catalyze the research, development, and deployment of DL intelligent solutions. However, the difference in computation paradigm, architecture design and implementation of existing DL frameworks and platforms brings challenges for DL software development, deployment, maintenance, and migration. Up to the present, it still lacks a comprehensive study on how current diverse DL frameworks and platforms influence the DL software development process. In this paper, we initiate the first step towards the investigation on how existing state-of-the-art DL frameworks (i.e., TensorFlow, Theano, and Torch) and platforms (i.e., server/desktop, web, and mobile) support the DL software development activities. We perform an in-depth and comparative evaluation on metrics such as learning accuracy, DL model size, robustness, and performance, on state-of-the-art DL frameworks across platforms using two popular datasets MNIST and CIFAR-10. Our study reveals that existing DL frameworks still suffer from compatibility issues, which becomes even more severe when it comes to different platforms. We pinpoint the current challenges and opportunities towards developing high quality and compatible DL systems. To ignite further investigation along this direction to address urgent industrial demands of intelligent solutions, we make all of our assembled feasible toolchain and dataset publicly available.

연구 동기 및 목표

  • 다양한 딥러닝 프레임워크가 딥러닝 소프트웨어 시스템의 개발, 배포, 이관에 미치는 영향을 조사한다.
  • 프레임워크 및 플랫폼이 모델 정확도, 성능, 내구성에 미치는 영향에 대한 체계적인 비교 연구의 부족을 보완한다.
  • 실제 배포 환경에서 프레임워크 및 플랫폼 간 호환성 문제와 구현 일관성의 결여를 특정한다.
  • 대규모이고 재현 가능한 딥러닝 프레임워크 및 플랫폼에 대한 실증 연구를 가능하게 하는 검증된 재사용 가능한 도구 체인과 데이터셋을 제공한다.
  • 이질적인 환경 간 이식 가능하고 고품질이며 상호운용성이 뛰어난 딥러닝 시스템 개발을 지원한다.

제안 방법

  • 서버/데스크톱, 웹(기본적으로 TensorFlow.js를 통해), 모바일(기본적으로 TensorFlow Lite를 통해)의 세 가지 플랫폼에서 최신 딥러닝 프레임워크인 TensorFlow, Theano, Torch를 비교 평가하였다.
  • MNIST 및 CIFAR-10 데이터셋을 사용하여 동일한 딥넷 아키텍처와 동일한 초모수를 가진 모델을 모든 프레임워크-플랫폼 조합에서 훈련시켰다.
  • 훈련 정확도, 추론 성능, 모델 크기, 적대적 예제에 대한 내구성, 에너지 효율성 등의 핵심 지표를 측정하고 비교하였다.
  • 재현 가능성과 공정한 교차 프레임워크 비교를 보장하기 위해 표준화된 벤치마킹 절차를 적용하였다.
  • 모든 구성에서 훈련된 모델 및 실행 로그의 포괄적인 데이터셋을 수집하고 검증하였다.
  • 향후 딥러닝 프레임워크 및 플랫폼 간 상호운용성에 대한 실증 연구를 지원하기 위해 완전히 조립되고 수작업으로 검증된 도구 체인을 공개하였다.

실험 결과

연구 질문

  • RQ1RQ1: 동일한 DNN 설계와 런타임 훈련 설정을 가질 경우, 서로 다른 딥러닝 프레임워크에 구현되었을 때 런타임 동작 방식과 훈련 성능에 차이가 나타나는가?
  • RQ2RQ2: 동일한 설계와 런타임 설정을 가진 딥러닝 모델이 서로 다른 프레임워크에서 훈련되었을 때, 플랫폼 간 예측 성능에 어떤 차이가 있는가?
  • RQ3RQ3: 프레임워크 및 플랫폼의 차이가 모델의 내구성, 특히 적대적 공격에 대한 저항성에 어떤 영향을 미치는가?
  • RQ4RQ4: 프레임워크 및 플랫폼 간에 모델 크기, 추론 속도, 에너지 소비의 성능 및 효율성 트레이드오프는 어떠한가?

주요 결과

  • 동일한 DNN 아키텍처와 훈련 설정이라도 프레임워크에 따라 정확도와 성능가 다르게 나타나, 동일한 설계일지라도 실제 실행 구현 방식에 따라 행동이 달라지는 것을 확인하였다.
  • 특히 모바일 및 웹 플랫폼에 모델을 배포할 경우 추론 속도와 모델 크기 측면에서 뚜렷한 성능 격차가 관찰되었다.
  • 적대적 예제에 대한 내구성은 프레임워크에 따라 상당한 차이를 보였으며, 일부 모델은 특정 프레임워크를 사용할 경우 더 높은 취약성을 보였다.
  • 프레임워크 간 모델 변환 과정에서 정확도 손실과 호환성 문제가 측정 가능한 수준으로 발생하였으며, 특히 데스크톱에서 모바일 또는 웹 플랫폼으로의 이관 시에 두드러졌다.
  • 에너지 효율성과 계산 효율성은 프레임워크 및 플랫폼 간에 크게 차이가 났으며, 모바일 최적화 프레임워크인 TensorFlow Lite가 모바일 기기에서 더 우수한 성능을 보였다.
  • 현재 프레임워크들이 플랫폼 간에 일관된 동작을 하지 못함을 드러내었으며, 재훈련 또는 피니팅 없이도 교차 플랫폼 배포 및 재사용이 어렵다는 점을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.