Skip to main content
QUICK REVIEW

[논문 리뷰] Fast, Exact and Multi-Scale Inference for Semantic Image Segmentation with Deep Gaussian CRFs

Siddhartha Chandra, Iasonas Kokkinos|arXiv (Cornell University)|2016. 03. 28.
Advanced Neural Network Applications참고 문헌 29인용 수 12
한 줄 요약

이 논문은 의미적 이미지 세그멘테이션을 위한 정확하고 빠르며 엔드 투 엔드 트레이닝 가능한 추론을 가능하게 하는 딥 가우시안 CRF 프레임워크를 제안한다. 구조적 예측을 이차 최적화 문제로 공식화함으로써, 선형 시스템 해법을 통해 정확한 MAP 추론을 달성하고, 효율적인 기울기 계산과 다중 해상도 특징 융합을 가능하게 하여, 다중 해상도 네트워크를 사용할 때 PASCAL VOC 2012에서 75.5%의 평균 IoU로 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In this work we propose a structured prediction technique that combines the virtues of Gaussian Conditional Random Fields (G-CRF) with Deep Learning: (a) our structured prediction task has a unique global optimum that is obtained exactly from the solution of a linear system (b) the gradients of our model parameters are analytically computed using closed form expressions, in contrast to the memory-demanding contemporary deep structured prediction approaches that rely on back-propagation-through-time, (c) our pairwise terms do not have to be simple hand-crafted expressions, as in the line of works building on the DenseCRF, but can rather be `discovered' from data through deep architectures, and (d) out system can trained in an end-to-end manner. Building on standard tools from numerical analysis we develop very efficient algorithms for inference and learning, as well as a customized technique adapted to the semantic segmentation task. This efficiency allows us to explore more sophisticated architectures for structured prediction in deep learning: we introduce multi-resolution architectures to couple information across scales in a joint optimization framework, yielding systematic improvements. We demonstrate the utility of our approach on the challenging VOC PASCAL 2012 image segmentation benchmark, showing substantial improvements over strong baselines. We make all of our code and experiments available at {https://github.com/siddharthachandra/gcrf}

연구 동기 및 목표

  • 의미적 세그멘테이션을 위한 딥 러닝과 정확한 추론을 결합한 구조적 예측 프레임워크를 개발하는 것.
  • 반복적 추론과 시간 역행을 통한 역전파에 의존하는 기존 딥 구조적 예측 방법에서 발생하는 메모리 및 근사화 문제를 해결하는 것.
  • 분석적으로 계산된 기울기를 사용하여 구조적 CRF 모듈을 갖춘 딥 네트워크의 엔드 투 엔드 학습을 가능하게 하는 것.
  • 다양한 해상도에서 특징을 동시에 최적화하여 세그멘테이션 정확도를 향상시키는 다중 해상도 아키텍처를 탐색하는 것.
  • 학습된 상위 상관관계 잠재변수를 갖는 정확한 추론이 딥 구조적 모델에서 근사 추론을 능가할 수 있는지 증명하는 것.

제안 방법

  • 사후 확률을 가우시안 조건부 무작위 필드(G-CRF)로 공식화함으로써, 유일한 전역 최적해를 갖는 이차 에너지 함수를 도출한다.
  • 정확한 추론은 이차 에너지에서 유도된 희소 선형 시스템을 푸름으로써 수행되며, 이는 빠르고 결정적인 최적화를 가능하게 한다.
  • 모델 파라미터의 기울기는 백트래킹을 피하기 위해 닫힌 형태의 표현식을 사용하여 분석적으로 계산된다.
  • 쌍방향 잠재변수는 딥 신경망을 통해 엔드 투 엔드로 학습되며, 전통적인 디스크리트 CRF에서 사용되는 수작업으로 만든 항목을 대체한다.
  • 다중 해상도 아키텍처를 도입하여, 공동 최적화 프레임워크 내에서 다양한 해상도 간의 특징을 결합한다.
  • 프레임워크는 Caffe를 사용하여 구현되었으며 GPU 추론을 최적화하여 이미지당 0.003~0.02초의 추론 시간을 달성했다.

실험 결과

연구 질문

  • RQ1반복적 근사에 의존하지 않고 딥 러닝 프레임워크 내에서 구조적 예측의 정확한 추론을 효율적으로 달성할 수 있는가?
  • RQ2시간 역행을 통한 역전파 대신 분석적으로 유도된 기울기를 사용하여, 구조적 CRF 모듈을 갖춘 딥 네트워크의 엔드 투 엔드 학습을 수행할 수 있는가?
  • RQ3딥 네트워크를 통해 데이터로부터 쌍방향 잠재변수를 학습하면 수작업으로 만든 잠재변수보다 세그멘테이션 성능을 향상시킬 수 있는가?
  • RQ4공동 최적화 프레임워크 내에서의 다중 해상도 특징 융합이 세그멘테이션 정확도 향상에 체계적인 기여를 할 수 있는가?
  • RQ5제안된 방법은 계산 효율성을 유지하면서도 CRF-RNN과 같은 최신 기술 수준의 접근법을 능가할 수 있는가?

주요 결과

  • 제안된 방법은 PASCAL VOC 2012 벤치마크에서 75.5%의 평균 IoU를 달성하여 이전 최신 기술 수준인 CRF-RNN 시스템을 0.8% 향상시켰다.
  • Potts 유형의 쌍방향 경우 GPU에서 0.003초, 일반 경우 0.02초 내에 정확한 추론을 수행하였다.
  • 다중 해상도 QO mres 아키텍처는 기준 네트워크 대비 비행기 尾, 인간의 사지, 도로 경계 등의 세밀한 디테일을 더 잘 포착하는 데 기여했다.
  • Deeplab-v2 ResNet-101 네트워크와 결합했을 때, CRF 보정 후 평균 IoU가 80.2%에 도달하여 원본 모델의 CRF 후처리 결과인 79.7%를 초월했다.
  • 정성적 결과에서는 단순히 음영이나 가림으로 인해 단일 스코어가 모호한 경우에도 더 선명한 객체 경계를 생성하고 세밀한 디테일을 더 잘 유지하는 것으로 나타났다.
  • 프레임워크는 분석적으로 계산된 기울기를 사용하여 엔드 투 엔드 학습을 가능하게 하여, 추론 단계의 메모리 집약적인 펼침(unrolling)이 필요 없어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.