Skip to main content
QUICK REVIEW

[논문 리뷰] Pixel Objectness: Learning to Segment Generic Objects Automatically in Images and Videos

Bo Xiong, Suyog Dutt Jain|arXiv (Cornell University)|2018. 08. 11.
Visual Attention and Saliency Detection인용 수 5
한 줄 요약

이 논문은 외관 및 운동 신호를 융합한 두 개의 스트림으로 구성된 완전 컨volution 신경망을 사용하여 이미지 및 영상에서 일반적인 물체를 자동으로 세분화하는 엔드 투 엔드 딥 러닝 프레임워크인 Pixel Objectness를 제안한다. 인간의 수동 애너테이션 없이도 여러 벤치마크에서 최신 기술을 초월하며, 수동 입력이 필요 없는 부분적으로만 학습된 방법보다 뛰어나고, 수동 입력이 필요한 반감독 학습 방법과도 맞먹거나 이를 뛰어넘는 성능을 달성한다.

ABSTRACT

We propose an end-to-end learning framework for segmenting generic objects in both images and videos. Given a novel image or video, our approach produces a pixel-level mask for all "object-like" regions---even for object categories never seen during training. We formulate the task as a structured prediction problem of assigning an object/background label to each pixel, implemented using a deep fully convolutional network. When applied to a video, our model further incorporates a motion stream, and the network learns to combine both appearance and motion and attempts to extract all prominent objects whether they are moving or not. Beyond the core model, a second contribution of our approach is how it leverages varying strengths of training annotations. Pixel-level annotations are quite difficult to obtain, yet crucial for training a deep network approach for segmentation. Thus we propose ways to exploit weakly labeled data for learning dense foreground segmentation. For images, we show the value in mixing object category examples with image-level labels together with relatively few images with boundary-level annotations. For video, we show how to bootstrap weakly annotated videos together with the network trained for image segmentation. Through experiments on multiple challenging image and video segmentation benchmarks, our method offers consistently strong results and improves the state-of-the-art for fully automatic segmentation of generic (unseen) objects. In addition, we demonstrate how our approach benefits image retrieval and image retargeting, both of which flourish when given our high-quality foreground maps. Code, models, and videos are at:http://vision.cs.utexas.edu/projects/pixelobjectness/

연구 동기 및 목표

  • 사용자 정의 카테고리에 의존하지 않고 이미지 및 영상에서 픽셀 수준의 전경 세분화를 수행할 수 있는 일반적인, 카테고리 독립적인 방법을 개발하는 것.
  • 외관 및 운동 신호를 하나의 엔드 투 엔드 학습 가능한 딥 네트워크에 통합하여 세분화의 강건성을 향상시키는 것.
  • 이미지 수준의 레이블 및 약한 애너테이션된 영상과 같은 약한 지도 학습 데이터를 활용하면서도, 고비용의 픽셀 수준 애너테이션에 대한 의존도를 줄이기 위해 희박한 경계 애너테이션을 함께 활용하는 것.
  • 정적 또는 복잡한 물체에 대해서도 인간의 간섭 없이 완전히 자동으로 세분화를 수행할 수 있도록 하는 것.
  • 고품질의 자동 전경 맵을 통해 이미지 검색 및 리타겟팅과 같은 후행 작업을 향상시키는 것.

제안 방법

  • 두 개의 스트림으로 구성된 완전 컨볼루션 네트워크가 외관 및 운동 특징을 별도로 처리하며, 운동 스트림은 영상 프레임의 옵티컬 플로우를 입력으로 사용한다.
  • 다중 스케일에서 외관 및 운동 특징을 융합하여 픽셀 단위의 물체성 맵을 생성하며, 이는 각 픽셀에 대해 전경/배경을 예측한다.
  • 이미지 수준의 레이블, 경계 수준의 애너테이션, 약한 애너테이션된 영상 프레임을 조합하여 네트워크를 엔드 투 엔드로 학습시킨다.
  • 영상 처리의 경우, 이미지 학습 모델에서 출발하여 프레임 간의 시간적 일관성을 통합 최적화를 통해 활용한다.
  • 최종 세분화 마스크의 공간 일관성을 보장하기 위해 구조적 예측 손실을 사용한다.
  • 약한 지도 학습(예: 이미지 수준의 레이블)과 제한된 강한 지도 학습(예: 경계 수준의 애너테이션)을 결합한 자료 효율적인 학습 전략을 통합한다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 카테고리별 지도 학습 없이도 수천 가지의 미리보지 않은 카테고리의 일반적인 물체를 세분화할 수 있는가?
  • RQ2외관 및 운동 신호를 하나의 딥 네트워크에 효과적으로 융합하여 움직이는 물체뿐 아니라 정적 물체의 세분화 성능을 향상시킬 수 있는가?
  • RQ3이미지 수준의 레이블 및 약한 애너테이션된 영상과 같은 약한 지도 학습이, 고비용의 픽셀 수준 애너테이션을 얼마나 대체할 수 있는가?
  • RQ4완전히 자동화된 방법이 인간의 입력 없이도 반감독 또는 상호작용 기반 방법보다 영상 물체 세분화에서 뛰어난 성능을 낼 수 있는가?
  • RQ5외관 및 운동 신호를 함께 사용할 경우, 각각을 별도로 사용할 때보다 세분화 정확도가 얼마나 향상되는가?

주요 결과

  • DAVIS 2016 벤치마크에서 제안된 방법은 모든 완전 자동화 방법보다 뛰어난 성능을 보였으며, Jaccard 점수 72.4%를 기록하여 다음으로 우수한 방법보다 10.5%포인트 높았다.
  • YouTube-Objects 데이터셋에서 이 방법은 Jaccard 점수 58.3%를 기록하여, 이 데이터셋에서 뛰어난 성능을 보인 다음으로 우수한 자동화 방법(NLC)보다 25%포인트 높았다.
  • Segtrack-v2 데이터셋에서 이 방법은 NLC를 제외한 모든 자동화 방법보다 뛰어난 성능을 보였으며, 저해상도이자 도전적인 영상에서도 강력한 성능을 입증했다.
  • 통합 모델은 개별 외관 스트림 및 운동 스트림보다 뚜렷한 성능 향상을 보였으며, 복잡한 환경에서 두 신호 간의 상호보완적 상호작용을 입증했다.
  • 모델은 인간의 개입이 전혀 없는 수준에서 MSK 및 IVID와 같은 인간-중개형 최신 기술 방법보다 정확도에서 뛰어난 성능을 보였다.
  • 정성적 결과에서는 외관 신호가 실패하거나 운동 신호가 노이즈가 심할 경우에도 모델이 물체를 성공적으로 세분화하는 것으로 나타나, 실제 환경의 변동성에 대한 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.