Skip to main content
QUICK REVIEW

[논문 리뷰] Pixel Objectness

Suyog Dutt Jain, Bo Xiong|arXiv (Cornell University)|2017. 01. 19.
Advanced Image and Video Retrieval Techniques참고 문헌 48인용 수 6
한 줄 요약

이 논문은 단일 이미지 내 모든 물체 유사 영역에 대해 픽셀 수준의 전경 세그먼테이션을 생성하는 새로운 엔드 투 엔드 딥 러닝 프레임워크인 Pixel Objectness를 소개한다. 이는 훈련 중에 이미지 수준의 레이블과 희박한 경계(annotation)를 결합함으로써 ImageNet과 MIT Object Discovery에서 최신 기술 수준의 성능을 달성하며, 100만 개 이상의 새로운 이미지에 대해 효과적으로 일반화되며, 이미지 검색 및 리타겟팅과 같은 후행 작업을 향상시킨다.

ABSTRACT

We propose an end-to-end learning framework for generating foreground object segmentations. Given a single novel image, our approach produces pixel-level masks for all object-like regions---even for object categories never seen during training. We formulate the task as a structured prediction problem of assigning foreground/background labels to all pixels, implemented using a deep fully convolutional network. Key to our idea is training with a mix of image-level object category examples together with relatively few images with boundary-level annotations. Our method substantially improves the state-of-the-art on foreground segmentation for ImageNet and MIT Object Discovery datasets. Furthermore, on over 1 million images, we show that it generalizes well to segment object categories unseen in the foreground maps used for training. Finally, we demonstrate how our approach benefits image retrieval and image retargeting, both of which flourish when given our high-quality foreground maps.

연구 동기 및 목표

  • 모든 이미지에 대해 밀도 높은 애너테이션을 요구하지 않고도 정확한 픽셀 수준의 물체 세그먼테이션을 생성하는 방법을 개발하는 것.
  • 학습 중에 볼 수 없었던 물체 카테고리로의 일반화 문제를 해결하는 것.
  • ImageNet과 MIT Object Discovery와 같은 벤치마크 데이터셋에서 전경 세그먼테이션 성능을 향상시키는 것.
  • 최소한의 애너테이션 노력으로 대규모 이미지 컬렉션에 실용적으로 구현 가능한 것.
  • 이미지 검색 및 리타겟팅과 같은 후행 응용 분야에서의 유용성을 입증하는 것.

제안 방법

  • 이 방법은 전방향 컨볼루션 네트워크를 사용하여 모든 픽셀에 대해 전경/배경 레이블을 할당함으로써 구조적 예측 문제로 전경 세그먼테이션을 설정한다.
  • 훈련 중에 이미지 수준의 물체 카테고리 레이블과 소수의 경계 수준 애너테이션을 결합하여 사용한다.
  • 네트워크는 엔드 투 엔드로 학습되어 픽셀 수준의 마스크를 예측하며, 이는 새로운 물체 카테고리에 대한 제로샷 일반화를 가능하게 한다.
  • 아키텍처는 공간 해상도를 유지하고 전체 이미지에 걸쳐 조밀한 예측을 지원하기 위해 완전 컨볼루션 계층을 사용한다.
  • 혼합 지도 학습을 통해 이미지 수준의 레이블에서 분류 가능한 특징을 학습하면서도, 경계 애너테이션을 통해 물체 경계를 정밀하게 보정한다.
  • 이 프레임워크는 확장성과 효율성이 뛰어나 대규모 이미지 컬렉션에서 추론을 수행할 수 있다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 이미지 수준 및 희박한 경계 애너테이션만으로도 고성능의 픽셀 수준 전경 세그먼테이션을 달성할 수 있는가?
  • RQ2학습 전경 지ap에 존재하지 않는 물체 카테고리로의 일반화 성능는 어떠한가?
  • RQ3이미지 수준 + 경계 수준의 혼합 지도 학습이 세그먼테이션 정확도와 일반화 능력에 어떤 영향을 미치는가?
  • RQ4생성된 전경 지도가 이미지 검색 및 리타겟팅과 같은 후행 비전 작업을 향상시킬 수 있는가?
  • RQ5이 방법은 ImageNet과 MIT Object Discovery와 같은 대규모 데이터셋에서 어떻게 성능를 발휘하는가?

주요 결과

  • 이 방법은 ImageNet과 MIT Object Discovery 데이터셋에서 전경 세그먼테이션 분야에서 최신 기술 수준의 성능를 달성한다.
  • 학습 중에 볼 수 없었던 물체 카테고리가 포함된 100만 개 이상의 이미지에 대해 효과적으로 일반화된다.
  • 고품질의 전경 지도가 제공될 경우 이미지 검색 및 이미지 리타겟팅 성능이 크게 향상된다.
  • 이미지 수준 레이블과 희박한 경계 애너테이션을 결합한 혼합 지도 학습 방식은 최소한의 애너테이션 비용으로도 뛰어난 성능를 가능하게 한다.
  • 이 프레임워크는 기존 방법에 비해 뛰어난 제로샷 일반화 능력을 보이며, 핵심적인 기술적 진전을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.