Skip to main content
QUICK REVIEW

[논문 리뷰] MODNet: Real-Time Trimap-Free Portrait Matting via Objective Decomposition

Zhanghan Ke, Jiayu Sun|arXiv (Cornell University)|2020. 11. 24.
Image Enhancement Techniques인용 수 5
한 줄 요약

MODNet는 트림랩이나 다단계 추론을 필요로 하지 않고도 최신 기술 수준의 성능을 달성하는 경량이며 실시간 포트레이트 매트팅 네트워크이다. 단일 입력 이미지를 사용하여 명시적 제약 조건을 통해 복수의 하위 목표를 동시에 최적화하며, 효율적인 아트로우스 스페이셜 피드백 풀링(e-ASPP) 모듈과 자기지도 학습 기반 하위 목표 일致성(SOC) 전략을 도입하여 효율성과 강건성을 향상시켰다. 이로 인해 1080Ti GPU에서 67 FPS의 성능을 기록했으며, Adobe 및 새로 제안된 PPM-100 벤치마크에서 이전의 트림랩 없는 방법들을 능가했다.

ABSTRACT

Existing portrait matting methods either require auxiliary inputs that are costly to obtain or involve multiple stages that are computationally expensive, making them less suitable for real-time applications. In this work, we present a light-weight matting objective decomposition network (MODNet) for portrait matting in real-time with a single input image. The key idea behind our efficient design is by optimizing a series of sub-objectives simultaneously via explicit constraints. In addition, MODNet includes two novel techniques for improving model efficiency and robustness. First, an Efficient Atrous Spatial Pyramid Pooling (e-ASPP) module is introduced to fuse multi-scale features for semantic estimation. Second, a self-supervised sub-objectives consistency (SOC) strategy is proposed to adapt MODNet to real-world data to address the domain shift problem common to trimap-free methods. MODNet is easy to be trained in an end-to-end manner. It is much faster than contemporaneous methods and runs at 67 frames per second on a 1080Ti GPU. Experiments show that MODNet outperforms prior trimap-free methods by a large margin on both Adobe Matting Dataset and a carefully designed photographic portrait matting (PPM-100) benchmark proposed by us. Further, MODNet achieves remarkable results on daily photos and videos. Our code and models are available at https://github.com/ZHKKKe/MODNet, and the PPM-100 benchmark is released at https://github.com/ZHKKKe/PPM.

연구 동기 및 목표

  • 비용이 많이 들거나 보조 입력이 필요한 복잡한 파ip라인 없이 실시간, 트림랩 없는 포트레이트 매트팅 방법을 개발하는 것.
  • 실제 환경 데이터로의 일반화 능력을 향상시켜 트림랩 없는 매트팅에서 발생하는 도메인 이동 문제를 해결하는 것.
  • 다양한 매트팅 하위 목표를 동시에 최적화하는 경량의 단일 단계 네트워크를 설계하여 효율성과 정확도를 높이는 것.
  • 다양하고 실제 환경의 포트레이트 이미지를 포함한 새로운 고품질 벤치마크(People Portrait Matting-100, PPM-100)를 제안하여 트림랩 없는 포트레이트 매트팅 방법의 공정한 평가를 가능하게 하는 것.

제안 방법

  • MODNet은 단일 RGB 입력만을 사용하여 포지티브, 배경, 알파 값 예측 등의 복수의 하위 목표를 명시적 제약 조건을 통해 단일 단계 아키텍처에서 동시에 최적화한다.
  • 표준 ASPP 대비 파rameter와 FLOPs를 1%로 줄이는 효율적인 아트로우스 스페이셜 피드백 풀링(e-ASPP) 모듈을 도입하여 다중 척도 특징 융합 성능을 유지하면서도 성능을 향상시켰다.
  • e-ASPP 모듈은 채널 감소, 다중 척도 특징 추출, 특징 융합, 채널 간 융합를 통해 의미적 추정을 가속화한다.
  • 훈련 중 예측된 하위 목표 간 일관성을 강제하여 도메인 이동 영향을 줄이고 강건성을 향상시키기 위해 자기지도 학습 기반 하위 목표 일관성(SOC) 전략을 제안한다.
  • 모델은 종단간 훈련 방식으로 학습되어 복잡한 파이프라인이나 보조 감독 없이도 효율적인 최적화가 가능하다.
  • 메서드는 Adobe 매트팅 데이터셋과 실제 환경의 다양한 포트레이트 이미지를 포함한 새로운 고품질 PPM-100 벤치마크에서 평가되었다.

실험 결과

연구 질문

  • RQ1단일 단계, 트림랩 없는 포트레이트 매트팅 네트워크가 고성능을 유지하면서도 실시간 추론을 달성할 수 있는가?
  • RQ2포트레이트 매트팅에서 의미 표현을 손상시키지 않으면서도 다중 척도 특징 융합을 어떻게 효율적으로 구현할 수 있는가?
  • RQ3하위 목표 간 자기지도 일관성이 실생활 데이터로의 일반화 능력을 향상시키고 도메인 이동을 줄일 수 있는가?
  • RQ4기존의 트림랩 없는 방법 및 다단계 접근법과 비교해 본다면, 제안된 방법은 속도, 정확도, 강건성 측면에서 어떤가?
  • RQ5새로운 고품질 벤치마크가 포트레이트 매트팅 평가의 공정성과 재현 가능성을 향상시킬 수 있는가?

주요 결과

  • MODNet은 512×512 입력으로 GTX 1080Ti GPU에서 67 FPS의 추론 속도를 기록하여 동시대의 다른 방법들을 크게 앞서 간다.
  • Adobe 매트팅 데이터셋에서 MODNet은 평균 제곱 오차(MSE) 0.0082와 평균 절대 차이(MAD) 0.0157을 기록하여 이전의 트림랩 없는 방법들을 능가했다.
  • 자기지도 학습 기반 SOC 전략을 적용한 결과, CRGNN-R 벤치마크에서 MSE는 0.0033, MAD는 0.0084로 감소하여 강건성이 향상됨을 입증했다.
  • 새로 제안된 PPM-100 벤치마크에서 MODNet은 최신 기술 수준의 성능을 기록하여 다양한 실제 환경의 포트레이트 이미지에 대한 효과성을 입증했다.
  • 움직이는 물체가 배경에 들어오는 동적 환경에서도 배경 매트팅(BM)보다 MODNet이 더 강건하여 성능이 뛰어나다.
  • e-ASPP 모듈은 표준 ASPP 대비 파라미터와 FLOPs를 1%로 줄였지만 경쟁 가능한 성능을 유지하여 효율성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.