Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Real-Time Automatic Portrait Matting on Mobile Devices

Seokjun Seo, Seungwoo Choi|arXiv (Cornell University)|2019. 04. 08.
Advanced Image and Video Retrieval Techniques참고 문헌 34인용 수 4
한 줄 요약

이 논문은 다중 지름 급격한 컨volution과 선형 복잡도 블록을 사용하여 모바일 기기용 경량이고 실시간 포트레이트 매트팅 모델인 MMNet을 제안한다. 최신 기술 수준의 모델보다 기울기 오차가 15% 높을 뿐이지만, Xiaomi Mi 5에서 30 FPS를 달성하며, Mobile DeepLabv3보다 파rameter 수를 한 차수만큼 줄였다.

ABSTRACT

We tackle the problem of automatic portrait matting on mobile devices. The proposed model is aimed at attaining real-time inference on mobile devices with minimal degradation of model performance. Our model MMNet, based on multi-branch dilated convolution with linear bottleneck blocks, outperforms the state-of-the-art model and is orders of magnitude faster. The model can be accelerated four times to attain 30 FPS on Xiaomi Mi 5 device with moderate increase in the gradient error. Under the same conditions, our model has an order of magnitude less number of parameters and is faster than Mobile DeepLabv3 while maintaining comparable performance. The accompanied implementation can be found at \url{https://github.com/hyperconnect/MMNet}.

연구 동기 및 목표

  • 모바일 기기에서 자동 포트레이트 매트팅을 위한 실시간 추론를 달성하는 데 도전한다.
  • 매트팅 품질을 희생시키지 않고 모델 크기와 계산 비용을 줄인다.
  • 트림랩이나 스케치와 같은 사용자 상호작용 입력에 의존하는 기존 방법의 한계를 극복한다.
  • строго한 지연 시간과 파라미터 제약 조건 하에서도 높은 성능을 유지하는 컴act한 신경망을 개발한다.
  • 사진 편집 및 영상 처리와 같은 실용적인 모바일 애플리케이션에 실시간 포트레이트 매트팅을 구현할 수 있도록 한다.

제안 방법

  • 공간적 세부 정보를 유지하기 위해 스킵 커넥션을 갖춘 인코더-디코더 아키텍처를 채택한다.
  • FLOPs와 모델 크기를 줄이기 위해 깊이 분리형 컨볼루션을 기본 연산으로 사용한다.
  • 다양한 확장률을 가진 다중 지름 급격한 컨볼루션을 도입하여 다중 척도의 맥락을 효율적으로 포착한다.
  • 표현 능력을 향상시키면서도 효율성을 유지하기 위해 선형 복잡도 블록을 활용한다.
  • 모델 용량, 지연 시간, 파라미터 수를 제어하기 위해 너비 배수를 적용한다.
  • 알파 매트의 품질을 향상시키기 위해 새로운 기울기 손실과 다중 보조 손실을 도입한다.

실험 결과

연구 질문

  • RQ1작은 신경망이 성능 저하 없이 모바일 기기에서 실시간 포트레이트 매트팅을 달성할 수 있는가?
  • RQ2선형 복잡도 블록과 함께 사용된 다중 지름 급격한 컨볼루션은 정확도와 효율성 사이의 균형을 얼마나 효과적으로 달성하는가?
  • RQ3모바일 하드웨어에서 모델 크기, 지연 시간, 매트팅 품질 사이의 상충 관계는 어떠한가?
  • RQ4양자화와 모델 압축을 통해 정확도 손실을 최소화하면서 추론 속도를 얼마나 향상시킬 수 있는가?
  • RQ5제안된 아키텍처가 포트레이트 매트팅을 넘어 다른 이미지 매트팅 또는 영상 매트팅 작업으로 일반화될 수 있는가?

주요 결과

  • MMNet은 최신 기술 수준의 모델보다 기울기 오차가 15% 높을 뿐이지만, Xiaomi Mi 5에서 30 FPS를 달성하여 실시간 성능을 확보했다.
  • Mobile DeepLabv3보다 파라미터 수를 한 차수만큼 줄였음에도 불구하고 유사한 성능을 유지했다.
  • 8비트로의 양자화는 지연 시간을 25% 감소시키고 기울기 오차를 약간 향상시켜 저정밀도 추론에 대한 강건성을 입증했다.
  • 제거 실험을 통해 다중 지름 급격한 컨볼루션과 선형 복잡도 블록이 성능과 효율성에 핵심적인 역할을 한다는 것이 확인되었다.
  • 모바일 기기에서 지연 시간, 파라미터 수, 기울기 오차의 파레토 프론트에서 모든 이전 방법보다 뛰어난 성능을 보였다.
  • 구현 코드는 공개적으로 제공되며, 재현성과 향후 개발을 위해 https://github.com/hyperconnect/MMNet 에서 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.