Skip to main content
QUICK REVIEW

[논문 리뷰] Human Extraction and Scene Transition utilizing Mask R-CNN

Minkesh Asati, Worranitta Kraisittipong|arXiv (Cornell University)|2019. 07. 20.
Advanced Neural Network Applications참고 문헌 7인용 수 6
한 줄 요약

이 논문은 마스크 R-CNN을 사용하여 이미지 및 영상에서 사람 추출과 장면 전환을 수행하는 방법을 제안한다. 이는 가림을 겪는 경우에도 다수의 사람을 정밀하게 인스턴스 세그멘테이션할 수 있도록 하며, 5 fps의 실시간 성능을 달성하여 사용자가 개인을 추출하고 새로운 배경에 복합화하여 가족 및 친구의 기록적인 기쁨을 담은 시각적 컬렉션을 만들 수 있도록 한다.

ABSTRACT

Object detection is a trendy branch of computer vision, especially on human recognition and pedestrian detection. Recognizing the complete body of a person has always been a difficult problem. Over the years, researchers proposed various methods, and recently, Mask R-CNN has made a breakthrough for instance segmentation. Based on Faster R-CNN, Mask R-CNN has been able to generate a segmentation mask for each instance. We propose an application to extracts multiple persons from images and videos for pleasant life scenes to grouping happy moments of people such as family or friends and a community for QOL (Quality Of Life). We likewise propose a methodology to put extracted images of persons into the new background. This enables a user to make a pleasant collection of happy facial expressions and actions of his/her family and friends in his/her life. Mask R-CNN detects all types of object masks from images. Then our algorithm considers only the target person and extracts a person only without obstacles, such as dogs in front of the person, and the user also can select multiple persons as their expectations. Our algorithm is effective for both an image and a video irrespective of the length of it. Our algorithm does not add any overhead to Mask R-CNN, running at 5 fps. We show examples of yoga-person in an image and a dancer in a dance-video frame. We hope our simple and effective approach would serve as a baseline for replacing the image background and help ease future research.

연구 동기 및 목표

  • 개성 있는 물체(예: 개)에 의해 가려지는 경우에도 이미지 및 영상에서 다수의 사람을 추출할 수 있는 견고한 방법을 개발하기 위해.
  • 인스턴스 세그멘테이션을 통해 높은 정확도로 사람 인스턴스를 고립시켜 원활한 배경 교체를 가능하게 하기 위해.
  • 다양한 개인을 사용자 정의 선택하여 기쁨의 순간을 담은 개인화된 시각적 스토리텔링을 지원하기 위해.
  • 기본 마스크 R-CNN 아키텍처에 추가적인 계산 부담 없이 실시간 성능를 유지하기 위해.
  • 미래의 인간 중심 편집 기반 이미지 및 영상 편집 연구를 위한 단순하고 효과적인 기준을 제공하기 위해.

제안 방법

  • 각 감지된 사람에 대해 픽셀 수준의 마스크를 생성하기 위해 인스턴스 세그멘테이션을 위한 배경 모델로 마스크 R-CNN을 사용한다.
  • 클래스 레이블 기반으로 후처리를 적용하여 사람 인스턴스만 필터링하고, 개와 같은 비인간 물체는 제거한다.
  • 수동 또는 자동으로 다수의 대상 사람을 선택할 수 있도록 사용자 가이드 선택 메커니즘을 구현한다.
  • 선택된 사람 마스크를 새로운 배경 이미지 또는 영상 프레임에 전달하기 위해 이미지 복합 기법을 적용한다.
  • 정적 이미지와 영상 시퀀스를 동일하게 처리하여 영상 응용 분야에서 프레임 간 일관성을 유지한다.
  • 추론 속도를 5 프레임 매초로 최적화하여 마스크 R-CNN 아키텍처에 수정 없이도 실시간 성능를 확보한다.

실험 결과

연구 질문

  • RQ1마스크 R-CNN은 복잡한 장면에서 가림을 겪는 다수의 사람을 효과적으로 추출하도록 적절히 적응할 수 있는가?
  • RQ2이미지 및 영상에서 혼잡한 배경에서 사람 인스턴스를 얼마나 정확하게 세그멘테이션하고 고립할 수 있는가?
  • RQ3실시간 응용 분야에서 마스크 R-CNN을 사람 추출 및 장면 전환 기능으로 확장할 경우 성능 오버헤드는 얼마나 되는가?
  • RQ4사용자가 선택적으로 다수의 개인을 추출하고 새로운 장면에 복합화하면서도 시각적 품질을 유지할 수 있는가?
  • RQ5제안된 방법은 향후 인간 중심의 이미지 및 영상 편집 작업을 위한 실용적이고 효율적인 기준이 될 수 있는가?

주요 결과

  • 이 방법은 개와 같은 다른 물체에 의해 부분적으로 가려져 있어도 이미지 및 영상에서 다수의 사람 인스턴스를 성공적으로 추출한다.
  • 시스템은 추가적인 계산 비용 없이도 5 프레임 매초의 실시간 성능를 유지하여 영상 처리에 적합하다.
  • 사용자 정의 선택 기능을 통해 기쁨의 순간을 담은 개인화된 시각적 컬렉션을 영리하게 제작할 수 있다.
  • 정확한 사람 마스크 전달을 통해 새로운 배경에 사람 마스크를 이식함으로써 표정과 자세를 잘 유지하면서 고품질의 복합 편집을 달성한다.
  • 요가 자세가 담긴 정적 이미지와 다이내믹한 춤 영상 시퀀스를 포함한 다양한 장면에서 뛰어난 강건성을 보여준다.
  • 결과적으로 이 방법이 향후 인간 중심의 이미지 및 영상 편집 연구를 위한 실용적이고 효율적인 기준이 될 수 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.