Skip to main content
QUICK REVIEW

[논문 리뷰] Flow-based Video Segmentation for Human Head and Shoulders

Zijian Kuang, Xinran Tie|arXiv (Cornell University)|2021. 04. 20.
Advanced Image Processing Techniques참고 문헌 10인용 수 6
한 줄 요약

이 논문은 움직임 블러 상황에서 실시간으로 강건한 인간의 머리와 어깨 영역을 세분화할 수 있도록, 호른-슐루크 광학 흐름과 컨volution 신경망을 결합한 플로우 기반의 인코더-디코더 네트워크인 FUNet을 제안한다. 모델은 자체 제작한 데이터셋에서 평균 딱시 계수 0.96를 달성하여, 다이나믹 화상 회의 환경에서 기존 방법들을 능가한다.

ABSTRACT

Video segmentation for the human head and shoulders is essential in creating elegant media for videoconferencing and virtual reality applications. The main challenge is to process high-quality background subtraction in a real-time manner and address the segmentation issues under motion blurs, e.g., shaking the head or waving hands during conference video. To overcome the motion blur problem in video segmentation, we propose a novel flow-based encoder-decoder network (FUNet) that combines both traditional Horn-Schunck optical-flow estimation technique and convolutional neural networks to perform robust real-time video segmentation. We also introduce a video and image segmentation dataset: ConferenceVideoSegmentationDataset. Code and pre-trained models are available on our GitHub repository: \url{https://github.com/kuangzijian/Flow-Based-Video-Matting}.

연구 동기 및 목표

  • 헤드 숄링이나 손 흔들기와 같은 움직임 블러 상황에서 배경 제거의 정확성을 높이는 데 도전한다.
  • 정적 또는 운동 중인 전경 객체에서 실패하는 기존 배경 제거 방법(예: GMG, KNN)의 한계를 극복한다.
  • 청결한 배경 이미지나 광범위한 수동 앤오테이션을 필요로 하지 않는 실시간, 엔드 투 엔드 영상 세분화 모델을 개발한다.
  • 인간의 머리와 어깨 영상 세분화 분야의 연구를 지원하기 위해 새로운 벤치마크 데이터셋인 ConferenceVideoSegmentationDataset을 구축한다.
  • 깊이 학습 기반의 외관 특징과 광학 흐름 특징을 통합하여 영상 세분화의 강건성과 효율성을 향상시킨다.

제안 방법

  • 연속된 영상 프레임 간의 운동 특징을 추출하기 위해 호른-슐루크 광학 흐름 방법을 사용한다.
  • 원본 프레임의 외관 특징와 운동 특징을 유넷 스타일의 인코더-디코더 아키텍처를 통해 결합한다.
  • 실시간으로 인간의 머리와 어깨에 대한 전경 마스크를 예측하기 위해 컨volution 신경망을 사용한다.
  • 학습 안정성을 확보하기 위해 BCE With Logits Loss와 RMSProp 옵티마이저(초기 학습률 0.0001, 가중치 감쇠 1e-8, 모멘터엠 0.9)를 구현한다.
  • 마스크 예측을 정교화하기 위해 디코더 경로에서 광학 흐름과 외관 특징을 연결(concatenation)하여 통합한다.
  • 계산 효율성을 향상시키기 위해 훈련 중에 스케일링 요소를 적용하며, 향후 조정이 가능하다.

실험 결과

연구 질문

  • RQ1고전적 광학 흐름과 딥러닝을 융합한 하이브리드 모델이 움직임 블러 상황에서 영상 세분화의 강건성을 향상시킬 수 있는가?
  • RQ2운동 특징과 외관 특징의 통합이 다이나믹 영상 회의 환경에서의 세분화 정확도를 어떻게 향상시키는가?
  • RQ3회의 형식 영상으로 구성된 자체 제작 데이터셋이 영상 세분화 모델의 일반화 능력을 어느 정도 향상시키는가?
  • RQ4제안된 방법이 고해상도 배경 이미지나 수동 앤오테이션 없이도 실시간 추론를 달성할 수 있는가?
  • RQ5모델은 새로운 배경과 전경 주제를 가진 미사용 영상 시퀀스에서 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 FUNet 모델은 테스트 세트에서 평균 딱시 계수 0.96를 달성하여 예측 마스크와 진짜 마스크 간의 유사도가 매우 높음을 나타낸다.
  • 헤드 이동이나 손 흔들기와 같은 움직임 블러가 발생하는 영상 시퀀스에서도 모델이 강건한 성능을 보이며, Zoom의 배경 교체 기능이 실패하는 기존 시스템들에 비해 뛰어난 성능을 보인다.
  • 호른-슐루크 광학 흐름과 딥러닝의 통합은 추가적인 감독 신호나 청결한 배경 입력 없이도 정확한 운동 인식 세분화를 가능하게 한다.
  • 녹색 스크린을 사용한 10개의 회의 영상에서 촬영한 3600프레임으로 구성된 자체 제작 데이터셋인 ConferenceVideoSegmentationDataset은 모델의 효과적인 훈련과 평가를 가능하게 한다.
  • 모델는 BCE With Logits Loss와 RMSProp 옵티마이저를 사용해 엔드 투 엔드로 훈련되었으며, 단일 RTX 2080 Ti GPU에서 실시간 추론를 달성했다.
  • 향후 작업으로는 실제 회의 녹화 영상을 포함한 데이터셋 확장과, 프레임 보간을 위한 소프트맥스 스플래터링을 통한 추론 속도 향상이 포함된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.