Skip to main content
QUICK REVIEW

[논문 리뷰] Superpixel Segmentation with Fully Convolutional Networks

Fengting Yang, Qian Sun|arXiv (Cornell University)|2020. 03. 29.
Advanced Vision and Imaging참고 문헌 46인용 수 16
한 줄 요약

이 논문은 정규 이미지 격자에서 초픽셀 연결을 예측함으로써 딥 네ural 네트워크에 효율적으로 통합할 수 있는 완전 컨volution 네트워크(FCN)를 제안한다. 스테레오 매칭에서 학습된 초픽셀 연결을 사용해 다운샘플링 및 업샘플링을 수행함으로써 물체 경계를 유지하고, 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하며, 추론 속도는 50fps를 기록한다.

ABSTRACT

In computer vision, superpixels have been widely used as an effective way to reduce the number of image primitives for subsequent processing. But only a few attempts have been made to incorporate them into deep neural networks. One main reason is that the standard convolution operation is defined on regular grids and becomes inefficient when applied to superpixels. Inspired by an initialization strategy commonly adopted by traditional superpixel algorithms, we present a novel method that employs a simple fully convolutional network to predict superpixels on a regular image grid. Experimental results on benchmark datasets show that our method achieves state-of-the-art superpixel segmentation performance while running at about 50fps. Based on the predicted superpixels, we further develop a downsampling/upsampling scheme for deep networks with the goal of generating high-resolution outputs for dense prediction tasks. Specifically, we modify a popular network architecture for stereo matching to simultaneously predict superpixels and disparities. We show that improved disparity estimation accuracy can be obtained on public datasets.

연구 동기 및 목표

  • 비정규적인 초픽셀 격자에서 표준 컨볼루션의 비효율성 문제를 해결하기 위해 초픽셀을 딥 네럴 네트워크에 통합하는 데 도전한다.
  • 초픽셀 세그멘테이션과 스테레오 매칭과 같은 후행 작업을 위한 엔드 투 엔드 훈련을 가능하게 하는 방법을 개발한다.
  • 이중선형 업샘플링을 초픽셀 기반 업샘플링으로 대체하여 고해상도 밀집 예측 작업에서 세부 정보와 물체 경계를 유지한다.
  • 고정된 초픽셀 초기화보다 초픽셀과 작업 특화 출력의 공동 학습이 성능 향상에 기여함을 입증한다.

제안 방법

  • 초픽셀 세그멘테이션을 정규 격자 셀과 이미지 픽셀 간의 연결 점수 예측 문제로 포지셔닝하고, 엔드 투 엔드 학습을 위한 완전 컨볼루션 네트워크(FCN)를 사용한다.
  • 기존 초픽셀 알고리즘(예: SLIC)에서 흔히 사용하는 초기화 전략을 활용하여 초픽셀을 정규 격자 셀에 매핑함으로써 표준 컨볼루션 연산을 가능하게 한다.
  • 초픽셀 연결 행렬 Q를 학습하여 기능 집계(초픽셀 기반 다운샘플링) 및 예측 브로드캐스트(초픽셀 기반 업샘플링)를 미분 가능한 방식으로 수행한다.
  • 스테레오 매칭 네트워크(예: PSMNet)에서 표준 스트라이드-2 컨볼루션과 이중선형 업샘플링을 초픽셀 기반 연산으로 대체함으로써 공간적 세부 정보를 유지한다.
  • 초픽셀 세그멘테이션과 후행 작업(디스파리티 추정)을 함께 훈련시켜 상호 최적화를 가능하게 한다.
  • 훈련 중에 초픽셀의 밀도와 균일성을 정규화하기 위해 m=30 또는 m=60으로 조정된 수정된 SLIC 손실을 사용한다.

실험 결과

연구 질문

  • RQ1완전 컨볼루션 네트워크가 정규 격자에서 초픽셀 연결을 효과적으로 학습하면서 최신 기술 수준의 세그멘테이션 정확도를 유지할 수 있는가?
  • RQ2표준 이중선형 업샘플링을 초픽셀 기반 업샘플링으로 대체하면 스테레오 매칭에서 고해상도 디스파리티 추정 성능이 향상되는가?
  • RQ3초픽셀 세그멘테이션과 디스파리티 예측의 공동 훈련이 고정된 초픽셀 초기화보다 성능을 향상시키는가?
  • RQ4기존의 초픽셀 및 스테레오 매칭 접근법과 비교해 본다면, 제안된 방법은 속도, 정확도, 세부 정보 유지 측면에서 어떻게 성능을 내는가?

주요 결과

  • 제안된 FCN 기반 초픽셀 방법은 BSDS500 및 NYUv2 벤치마크에서 최신 기술 수준의 성능을 달성하며, 추론 속도는 약 50fps를 기록한다.
  • SceneFlow 데이터셋에서 공동 훈련 버전(Ours_joint)은 종단 오차(EPE)가 0.93을 기록하여 원본 PSMNet(1.04)을 능가한다.
  • 고해상도 HR-VS 데이터셋에서 Ours_joint는 EPE를 2.77로 줄여 PSMNet(3.83)을 크게 앞서며, 16× 업샘플링 요인을 감안할 때 특히 두각을 나타낸다.
  • Middlebury-v3에서 이 방법은 평균 오차 7.11을 기록하여 PSMNet(8.78)보다 뛰어난 성능을 보이며, 실제 고해상도 데이터에서의 우수성을 입증한다.
  • 절단 분석 결과, 공동 훈련이 핵심임을 확인했다. 고정된 초픽셀을 사용한 Ours_fixed는 원본 PSMNet보다 성능이 열 劣하므로, 엔드 투 엔드 최적화의 이점이 뚜렷하다.
  • 정성적 결과에서는 복잡한 무늬와 에지 영역에서 기존 기준 방법보다 제안된 방법이 더 나은 세부 정보 및 물체 경계 유지 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.