Skip to main content
QUICK REVIEW

[논문 리뷰] Fast and Accurate Single-Image Depth Estimation on Mobile Devices, Mobile AI 2021 Challenge: Report

Andrey Ignatov, Grigory Malivenko|arXiv (Cornell University)|2021. 05. 17.
Advanced Vision and Imaging참고 문헌 67인용 수 13
한 줄 요약

이 논문은 단일 이미지 깊이 추정을 위한 Mobile AI 2021 챌린지를 제시하며, ZED 스테레오 카메라로 촬영한 대규모 RGB-깊이 데이터셋을 도입하고, 모바일 장치에서 실시간 추론을 목표로 한다. 참가자들은 라즈베리 파이 4에서 최대 10 FPS를 달성하면서도 높은 정확도를 유지하는 효율적인, 텐서플로우 라이트 호환 모델을 개발하였다. 이는 자원이 제한된 하드웨어에서 깊이 추정을 실용적으로 구현한 사례이다.

ABSTRACT

Depth estimation is an important computer vision problem with many practical applications to mobile devices. While many solutions have been proposed for this task, they are usually very computationally expensive and thus are not applicable for on-device inference. To address this problem, we introduce the first Mobile AI challenge, where the target is to develop an end-to-end deep learning-based depth estimation solutions that can demonstrate a nearly real-time performance on smartphones and IoT platforms. For this, the participants were provided with a new large-scale dataset containing RGB-depth image pairs obtained with a dedicated stereo ZED camera producing high-resolution depth maps for objects located at up to 50 meters. The runtime of all models was evaluated on the popular Raspberry Pi 4 platform with a mobile ARM-based Broadcom chipset. The proposed solutions can generate VGA resolution depth maps at up to 10 FPS on the Raspberry Pi 4 while achieving high fidelity results, and are compatible with any Android or Linux-based mobile devices. A detailed description of all models developed in the challenge is provided in this paper.

연구 동기 및 목표

  • 모바일 및 IoT 플랫폼에서의 현장 추론을 위해 정확하고 효율적인 엔드 투 엔드 딥 러닝 기반 깊이 추정 모델을 개발하기 위해.
  • 고해상도 깊이 맵이 최대 50미터까지 가능하도록 실외에서 촬영한 새로운 대규모 데이터셋을 도입함으로써, 모바일 호환 깊이 추정의 격차를 해소하기 위해.
  • 데스크톱 GPU가 아닌 실질적인 저전력 하드웨어(Raspberry Pi 4)에서 평가함으로써 실용적인 효율성과 실시간 성능을 보장하기 위해.
  • 제한된 RAM과 일반적인 딥 러닝 연산자에 대한 비효율적 지원과 같은 모바일 전용 제약 조건을 고려하여 모델의 정밀도와 추론 속도의 균형을 맞추기 위해.
  • 모든 모델가 텐서플로우 라이트 및 안드로이드 신경망 API(이하 NNAPI) 또는 커스텀 딜리게이트와 호환되도록 하여 배포 이식성 향상시키기 위해.

제안 방법

  • 참가자들은 ZED 3D 스테레오 카메라를 사용해 촬영한 8,000개의 RGB-깊이 이미지 쌍으로 구성된 새로운 데이터셋을 기반으로 모델을 훈련시켰으며, 이는 최대 50미터 거리의 물체에 대해 고해상도 깊이 맵을 제공한다.
  • 모든 모델는 실시간 성능을 확보하기 위해 ARM 기반 Broadcom 칩셋을 탑재한 라즈베리 파이 4에서 평가되었다.
  • 핵심 아키텍처로는 수정된 U-Net, MobileNetV3Small, ResNet 기반 BTS, 그리고 주의력 강화형 인코더가 포함되었으며, 모두 정밀도 및 효율성을 고려해 정량화 및 자르기 기법을 적용해 모바일 추론에 최적화되었다.
  • 모델 훈련에는 깊이 맵의 정밀도와 가장자리 일致성을 향상시키기 위해 L1 손실, 기울기 L1 손실, SSIM 손실의 조합을 사용하였다.
  • 지식 증류, 저비트 정량화, 하드웨어 인식 신경망 아키텍처 탐색 등의 기법을 통해 효율성을 향상시켰다.
  • 최종 모델는 텐서플로우 라이트로 내보내졌으며, NNAPI, GPU, Hexagon 또는 커스텀 딜리게이트를 사용해 안드로이드 및 리눅스 기기에서의 크로스플랫폼 배포를 가속화하였다.

실험 결과

연구 질문

  • RQ1모바일 및 임베디드 장치에서 실시간으로 작동하는 모델을 통해 정확한 단일 이미지 깊이 추정을 달성할 수 있는가?
  • RQ2라즈베리 파이 4에서의 모델 성능는 표준 데스크톱 벤치마크와 비교해 지연 시간과 정확도 측면에서 어떻게 다를까?
  • RQ3모델 압축 및 하드웨어 인식 설계를 통해 추론 속도를 얼마나 향상시킬 수 있으며, 깊이 추정 정확도를 손상시키지 않을 수 있는가?
  • RQ4모바일 NPU와 ARM CPU에서 깊이 추정을 배포하기 위해 가장 효과적인 모델 아키텍처와 최적화 전략는 무엇인가?
  • RQ5오픈 프레임워크인 텐서플로우 라이트를 활용해 표준화되고 이식 가능하며 효율적인 깊이 추정 파이프라인을 모바일 AI 응용 프로그램에 구축할 수 있는가?

주요 결과

  • 최고의 성능을 보인 모델들은 라즈베리 파이 4에서 최대 10 FPS를 달성하면서도 높은 정밀도로 VGA 해상도의 깊이 맵을 생성하였다.
  • L1, 기울기 L1, SSIM 손실을 사용해 훈련된 모델들은 기준 방법에 비해 가장자리 일치성과 시각적 품질이 향상된 것으로 나타났다.
  • 지식 증류 및 모델 증류 기법은 정확도를 유지하면서도 모델 크기와 추론 시간을 크게 감소시켰다.
  • Hard-sigmoid 및 Leaky ReLU 활성화 함수의 사용은 성능 저하 없이도 모바일 하드웨어에서 추론 속도를 향상시켰다.
  • 모든 제출된 모델들은 텐서플로우 라이트를 활용해 성공적으로 모바일 플랫폼에 배포되었으며, NNAPI 또는 커스텀 딜리게이트를 통해 가속화되었다.
  • 이 챌린지는 표준화된 모델 압축 및 하드웨어 인식 설계를 통해 최신 기술 수준의 깊이 추정을 모바일 배포에 효과적으로 적응시킬 수 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.