Skip to main content
QUICK REVIEW

[논문 리뷰] MODNet-V: Improving Portrait Video Matting via Background Restoration

Jiayu Sun, Zhanghan Ke|arXiv (Cornell University)|2021. 09. 24.
Image Enhancement Techniques참고 문헌 46인용 수 5
한 줄 요약

이 논문은 배경 복원 모듈(BRM)을 도입한 경량 비디오 매트팅 모델인 MODNet-V를 제안한다. BRM는 이전 프레임들로부터 동적으로 배경을 복원하여 포트레이트 매트팅 성능을 햖थ한다. 사용자 제공 트림랩 또는 배경 이미지를 사용하지 않고 자기지도 학습 기반 배경 사전 지식을 활용함으로써, MODNet의 1/3 수준의 파라미터로도 뛰어난 성능을 달성하였으며, 단일 GPU에서 엔드 투 엔드 학습이 가능하고, 패치 정밀화 모듈(PRM)을 통해 고해상도 추론도 지원한다.

ABSTRACT

To address the challenging portrait video matting problem more precisely, existing works typically apply some matting priors that require additional user efforts to obtain, such as annotated trimaps or background images. In this work, we observe that instead of asking the user to explicitly provide a background image, we may recover it from the input video itself. To this end, we first propose a novel background restoration module (BRM) to recover the background image dynamically from the input video. BRM is extremely lightweight and can be easily integrated into existing matting models. By combining BRM with a recent image matting model, MODNet, we then present MODNet-V for portrait video matting. Benefited from the strong background prior provided by BRM, MODNet-V has only 1/3 of the parameters of MODNet but achieves comparable or even better performances. Our design allows MODNet-V to be trained in an end-to-end manner on a single NVIDIA 3090 GPU. Finally, we introduce a new patch refinement module (PRM) to adapt MODNet-V for high-resolution videos while keeping MODNet-V lightweight and fast.

연구 동기 및 목표

  • 사용자 제공 트림랩 또는 배경 이미지가 실시간 응용에서 비현실적이기 때문에, 실시간 응용에서의 포트레이트 비디오 매트팅 문제를 해결하는 것.
  • 트림랩 또는 사전 촬영된 배경 이미지의 수동 레이블링에 의존하는 것을 제거하여, 동적인 또는 실시간 시나리오에서 비용이 많이 들거나 비현실적인 문제를 해결하는 것.
  • 비디오 프레임 간의 시간적 일관성을 활용하여 동적 배경 사전 지식을 재구성함으로써 매트팅 성능 및 안정성을 향상시키는 것.
  • 고효율성과 확장성을 유지하면서 고해상도 비디오에 적합한 경량이며 엔드 투 엔드 학습 가능한 모델을 개발하는 것.

제안 방법

  • 연속된 비디오 프레임들로부터 배경을 반복적으로 업데이트하고 복원할 수 있도록 잠재 배경 특징과 이진 마스크를 유지하는 배경 복원 모듈(BRM)을 제안한다.
  • BRM을 MODNet에 통합하여 MODNet-V를 구성하며, 복원된 배경이 각 프레임의 알파 매트 추론에 동적 사전 지식으로 기능한다.
  • 이중 단계 학습 전략을 적용한다: 첫 번째 단계에서는 메모리 사용을 줄이기 위해 프레임 샘플링(1번째 및 T번째 프레임)을 사용하여 MODNet과 BRM을 엔드 투 엔드로 학습하고, 두 번째 단계에서는 고해상도 데이터에서 패치 정밀화 모듈(PRM)을 미세 조정한다.
  • 신뢰도 임계값(ξ=0.01) 기반으로 고해상도 패치를 선택적으로 정밀화하는 패치 정밀화 모듈(PRM)을 도입하여, 약 6.5배의 정밀화 오버헤드 감소를 달성한다.
  • 결합 손실 함수를 사용한다: ℒα는 알파 매트 추론을 위한 것이고, ℒbg는 배경 재구성에 대한 지도를 제공하며, γ 가중치를 통해 경계 영역을 강조한다.
  • 다중 해상도 학습 전략을 적용하여, 비디오 시퀀스당 20개의 배경 이미지를 사용한 합성 복합 이미지 데이터를 활용함으로써 배경 변화에 대한 강건성을 향상시킨다.

실험 결과

연구 질문

  • RQ1과거 프레임들로부터 비디오 프레임의 배경을 효과적으로 복원하여 비디오 매트팅의 사전 지식으로 활용할 수 있는가?
  • RQ2사용자 제공 사전 지식(예: 트림랩 또는 배경 이미지)이 필요한 모델보다 자기지도 학습 기반 배경 복원 메커니즘이 더 우수한 성능을 낼 수 있는가?
  • RQ3기존 매트팅 모델의 아키텍처를 변경하지 않고도 경량 BRM을 통합하여 성능 향상과 모델 크기 감소를 동시에 달성할 수 있는가?
  • RQ4제안된 PRM은 높은 계산 비용 없이도 고해상도 비디오에서 효율적이고 고품질의 추론을 가능하게 할 수 있는가?
  • RQ5BRM과 PRM의 조합이 다양한 실제 비디오 시퀀스에서 더 안정적이고 정확한 매트팅 결과를 도출하는가?

주요 결과

  • MODNet-V는 실제 비디오 매트팅 데이터셋에서 MAD 65.63×10⁻⁴, MSE 32.39×10⁻⁴의 성능을 기록하여, MODNet(MAD: 83.30×10⁻⁴, MSE: 34.05×10⁻⁴)을 능가한다.
  • MODNet의 파라미터 수의 1/3 밖에 되지 않음에도 불구하고, 동일하거나 더 나은 성능을 달성하여 뛰어난 파라미터 효율성을 입증한다.
  • 1단계 학습 단계에서 1번째 및 T번째 프레임 샘플링을 활용함으로써, 단일 NVIDIA 3090 GPU에서 배치 크기 16으로 엔드 투 엔드 학습이 가능하다.
  • 패치 정밀화 모듈(PRM)은 신뢰도 임계값(ξ=0.01) 기반으로 결함 확률이 높은 15%의 패치만 처리함으로써 정밀화 오버헤드를 약 6.5배 감소시켰다.
  • 시각적 비교 결과, MODNet-V는 특히 헤어와 같은 어려운 영역에서 더 안정적이고 정확한 알파 매트를 생성함을 보여주었다. 이는 향상된 배경 사전 지식 덕분이었다.
  • BRM는 시간이 지남에 따라 배경 표현을 지속적으로 업데이트함으로써 동적 배경 처리에 효과적으로 대응하여, 배경이 시간에 따라 변화하는 상황에서 실패를 방지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.