Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Extreme Cut: From Extreme Points to Object Segmentation

Kevis-Kokitsi Maninis, Sergi Caelles|arXiv (Cornell University)|2017. 11. 24.
Advanced Neural Network Applications참고 문헌 34인용 수 15
한 줄 요약

DEXTR는 왼쪽 끝, 오른쪽 끝, 상단, 하단 픽셀과 같은 극단점(Extreme points)을 입력으로 사용하여 CNN에 추가된 가우시안 히트맵 채널을 통해 정밀한 객체 세그멘테이션을 생성하는 딥러닝 방법을 제안한다. 이는 상호작용형, 영상, 약한 감독 세그멘테이션에서 최신 기술 수준의 성능을 달성하며, 사용자 입력을 크게 줄여, 상자나 스크래치 기반 방법보다 최대 10% 높은 IoU 성능(4번 클릭 시)을 기록한다.

ABSTRACT

This paper explores the use of extreme points in an object (left-most, right-most, top, bottom pixels) as input to obtain precise object segmentation for images and videos. We do so by adding an extra channel to the image in the input of a convolutional neural network (CNN), which contains a Gaussian centered in each of the extreme points. The CNN learns to transform this information into a segmentation of an object that matches those extreme points. We demonstrate the usefulness of this approach for guided segmentation (grabcut-style), interactive segmentation, video object segmentation, and dense segmentation annotation. We show that we obtain the most precise results to date, also with less user input, in an extensive and varied selection of benchmarks and datasets. All our models and code are publicly available on http://www.vision.ee.ethz.ch/~cvlsegmentation/dextr/.

연구 동기 및 목표

  • 최소한의 사용자 입력을 통해 정밀한 이미지 및 영상 세그멘테이션의 어노테이션 비용을 줄이기 위해.
  • 상자나 스크래치 대신 극단점 감독을 통합하여 세그멘테이션 정확도를 향상시키기 위해.
  • 감독 모델 훈련을 위한 효율적이고 정확한 마스크 어노테이션을 가능하게 하기 위해.
  • 상호작용형, 영상, 약한 감독 세그멘테이션 작업 간에 통합되고 향상된 성능을 달성하기 위해.

제안 방법

  • 이 방법은 네 개의 극단점(왼쪽, 오른쪽, 상단, 하단) 각각에 중심을 둔 가우시안 히트맵 채널을 CNN 입력에 추가한다.
  • CNN은 이러한 극단점 히트맵이 제공하는 공간적 맥락을 활용하여 정밀한 객체 마스크를 예측한다.
  • 표준 세그멘테이션 손실 함수를 사용하여 지도 학습된 마스크가 포함된 데이터셋에서 엔드 투 엔드로 모델을 훈련시킨다.
  • 상호작용형 세그멘테이션을 위해, 추가적인 경계 클릭을 통해 잘못 분류된 영역에서 온라인 하드 예제 마이닝(OHEM)을 사용해 네트워크를 미세조정한다.
  • 이 방법은 추가적인 경계 클릭을 통해 네 개를 초과하는 점으로의 확장을 지원하여 세그멘테이션을 정밀화한다.
  • 재현성과 후속 작업에의 통합을 위해 사전 학습된 모델과 코드를 공개적으로 배포한다.

실험 결과

연구 질문

  • RQ1상자나 스크래치 기반 방법과 비교해 극단점 감독이 세그멘테이션 정확도를 향상시킬 수 있는가?
  • RQ2극단점 가이던스는 상호작용형 및 영상 객체 세그멘테이션 성능에 어떤 영향을 미치는가?
  • RQ3DEXTR는 감독 모델 훈련을 위한 지도 어노테이션과 유사한 고품질 마스크를 생성할 수 있는가?
  • RQ4이 방법은 성능을 유지하거나 향상시키면서 레이블링 비용을 줄일 수 있는가?

주요 결과

  • PASCAL VOC 2012 검증 세트에서 DEXTR는 단 4번의 클릭으로 91.5%의 IoU를 달성하며, 다음으로 우수한 성능을 보인 RIS-Net보다 10.8%포인트 높은 성능을 기록했다.
  • Grabcut 데이터셋에서 DEXTR는 4번 클릭 시 94.4%의 IoU를 기록하여 이전의 상호작용형 방법들보다 뚜렷이 뛰어난 성능을 보였다.
  • 어노테이션용으로 사용되었을 때, DEXTR가 생성한 마스크는 높은 정확도를 보이며, 지도 어노테이션을 사용해 훈련된 모델의 성능을 그대로 유지할 수 있었다.
  • 영상 객체 세그멘테이션에서 DEXTR는 DAVIS 2016 및 DAVIS 2017에 대해 뛰어난 초기화를 제공하여 추적 정확도를 향상시켰다.
  • 전체 픽셀 수준 어노테이션 대비 레이블링 비용을 10배 줄였음에도 불구하고 최신 기술 수준의 성능을 유지했다.
  • 5번째 클릭을 추가할 경우 성능 향상을 위해 온라인 하드 예제 마이닝(OHEM)이 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.