Skip to main content
QUICK REVIEW

[논문 리뷰] Inductive Guided Filter: Real-time Deep Image Matting with Weakly Annotated Masks on Mobile Devices

Yaoyi Li, Jianfu Zhang|arXiv (Cornell University)|2019. 05. 16.
Image Enhancement Techniques참고 문헌 36인용 수 4
한 줄 요약

이 논문은 약한 마스크 애너테이션을 입력으로 사용하여 가벼운 시계열 네트워크로 가속 필터를 매개변수화하는 실시간 딥 이미지 매트팅 방법인 Inductive Guided Filter를 제안한다. 고주파 무늬 모델링을 향상시키기 위해 고바르 손실을 도입하였으며, 높은 정확도와 빠른 속도를 달성하여 GPU에서 5000 FPS 이상, iPhone SE에서는 26ms 이내로 작동하여 기존 방법에 비해 효율성과 노이즈가 있는 마스크에 대한 강건성에서 뛰어난 성능을 발휘한다.

ABSTRACT

Recently, significant progress has been achieved in deep image matting. Most of the classical image matting methods are time-consuming and require an ideal trimap which is difficult to attain in practice. A high efficient image matting method based on a weakly annotated mask is in demand for mobile applications. In this paper, we propose a novel method based on Deep Learning and Guided Filter, called Inductive Guided Filter, which can tackle the real-time general image matting task on mobile devices. We design a lightweight hourglass network to parameterize the original Guided Filter method that takes an image and a weakly annotated mask as input. Further, the use of Gabor loss is proposed for training networks for complicated textures in image matting. Moreover, we create an image matting dataset MAT-2793 with a variety of foreground objects. Experimental results demonstrate that our proposed method massively reduces running time with robust accuracy.

연구 동기 및 목표

  • 모바일 배포에 적합한 실시간이고 효율적인 딥 이미지 매트팅 프레임워크를 개발하기.
  • 고품질 트라이맵에 대한 의존도를 줄여 약한 마스크 애너테이션으로도 강건한 성능을 달성하기.
  • 새로운 손실 함수를 통해 무늬 세부 정보 보존을 향상시키기.
  • 학습 및 평가를 위한 대규모이고 다양한 이미지 매트팅 데이터셋(MAT-2793)을 구축하기.
  • 모바일 및 엣지 디바이스에서 정확도를 희생시키지 않고도 고속 추론을 달성하기.

제안 방법

  • 원래의 가속 필터를 매개변수화하기 위해 실시간 학습이 가능한 경량 시계열 네트워크를 설계하였으며, 이미지와 마스크 입력을 받는다.
  • 단일 경량 기반 네트워크를 공유하는 듀얼 브랜치 아키텍처를 사용하여 알파 매트 추정을 위한 선형 계수 A와 B를 예측한다.
  • 새로운 고바르 손실을 도입하여 고주파 무늬 특징을 추출하고 세부 정보의 정확도를 향상시킨다.
  • 생성적 적대적 네트워크 기반 프레임워크를 사용하여 적대적 손실, L1 손실, 그리고 제안된 고바르 손실을 결합하여 현실감 있는 품질과 세부 정보를 향상시킨다.
  • 추론 가속을 위해 다운샘플링 요소가 4인 빠른 가속 필터를 사용하여 원래 필터의 효율성을 모방한다.
  • 실제 사용자 입력 노이즈를 시뮬레이션하기 위해 전경 마스크에 무작위로 팽창 및 침식을 적용하여 약한 마스크를 생성한다.

실험 결과

연구 질문

  • RQ1딥 러닝 기반 방법이 모바일 디바이스에서 이미지 매트팅에 대해 실시간 추론을 달성할 수 있는가?
  • RQ2정밀한 트라이맵이 필요로 하지 않고도 약한 마스크 애너테이션에 강건한 성능을 내는 모델은 어떻게 설계할 수 있는가?
  • RQ3고바르 필터 기반의 새로운 손실 함수가 이미지 매트팅에서 무늬 세부 정보 보존을 향상시킬 수 있는가?
  • RQ4경량 아키텍처로 모바일 하드웨어에서 어떤 성능과 속도를 달성할 수 있는가?
  • RQ5최신 기술 대비 정확도와 추론 지연 시간 측면에서 제안된 방법은 어떻게 비교되는가?

주요 결과

  • 제안된 방법은 배치 크기가 256인 단일 NVIDIA V100 GPU에서 5000 FPS 이상의 추론 속도를 달성하여 실시간 성능을 입증하였다.
  • iPhone SE(2016)에서 이미지당 25.9ms로 작동하여 실시간 생산 환경에서의 성능을 확보하였다.
  • 노이즈가 있거나 정확도가 떨어지는 입력 마스크가 있더라도 MAT-2793 및 Adobe Composition-1k 데이터셋 모두에서 강건한 성능을 발휘하였다.
  • 기본 방법과의 정성적 비교를 통해 고바르 손실이 무늬 세부 정보 보존을 크게 향상시켰음을 입증하였다.
  • 특히 약한 마스크 애너테이션 상황에서 Adobe DIM 및 기타 최신 기술 대비 빠른 속도를 유지하면서도 경쟁 가능한 정확도를 확보하였다.
  • 2793개의 다양한 전경 객체를 포함한 MAT-2793 데이터셋은 현재까지 공개된 바 있는 가장 큰 이미지 매트팅 데이터셋이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.