Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Statistical Texture for Semantic Segmentation

Lanyun Zhu, Deyi Ji|arXiv (Cornell University)|2021. 03. 06.
Advanced Neural Network Applications참고 문헌 37인용 수 8
한 줄 요약

이 논문은 통계적 텍스처 특징을 정량화 및 수량 셈부서(Quantization and Counting Operator, QCO)를 사용하여 명시적으로 모델링하는 새로운 프레임워크인 통계적 텍스처 학습 네트워크(Statistical Texture Learning Network, STLNet)를 제안한다. 저수준의 텍스처 세부 정보를 향상시키기 위해 텍스처 강화 모듈(Texture Enhancement Module, TEM)을 활용하고, 피라미드 텍스처 특징 추출 모듈(Pyramid Texture Feature Extraction Module, PTFEM)을 통해 다중 척도의 통계적 텍스처 특징을 추출함으로써, Cityscapes, PASCAL Context, ADE20K에서 각각 82.3%, 55.8%, 46.48%의 mIoU 점수를 기록하며 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Existing semantic segmentation works mainly focus on learning the contextual information in high-level semantic features with CNNs. In order to maintain a precise boundary, low-level texture features are directly skip-connected into the deeper layers. Nevertheless, texture features are not only about local structure, but also include global statistical knowledge of the input image. In this paper, we fully take advantages of the low-level texture features and propose a novel Statistical Texture Learning Network (STLNet) for semantic segmentation. For the first time, STLNet analyzes the distribution of low level information and efficiently utilizes them for the task. Specifically, a novel Quantization and Counting Operator (QCO) is designed to describe the texture information in a statistical manner. Based on QCO, two modules are introduced: (1) Texture Enhance Module (TEM), to capture texture-related information and enhance the texture details; (2) Pyramid Texture Feature Extraction Module (PTFEM), to effectively extract the statistical texture features from multiple scales. Through extensive experiments, we show that the proposed STLNet achieves state-of-the-art performance on three semantic segmentation benchmarks: Cityscapes, PASCAL Context and ADE20K.

연구 동기 및 목표

  • 기존 의미 분할 모델이 저수준 특징 내 통계적 텍스처 정보를 충분히 활용하지 못하는 한계를 해결하기 위해.
  • 딥 네트워크 내에서 전역 통계적 텍스처 분포를 명시적으로 모델링하는 방법을 제안하여 분할 정확도를 향상시키기 위해.
  • 히스토GRAM 균형화에 영감을 받은 학습 가능한 메커니즘을 사용하여 저수준 텍스처 세부 정보를 향상시키기 위해.
  • 계층적 구조를 사용하여 다중 척도의 통계적 텍스처 특징을 추출함으로써 강력한 특징 표현을 위한 피라미드 구조를 활용하기 위해.

제안 방법

  • 지속적인 텍스처 분포를 이산화된 수준으로 나누고 빈도를 세어 통계적 인코딩을 수행하기 위해 정량화 및 수량 셈부서(Quantization and Counting Operator, QCO)를 도입한다.
  • 정량화된 수준 간의 정보 전파를 통해 저수준 특징을 개선함으로써 히스토GRAM 균형화를 모방하는 텍스처 강화 모듈(Texture Enhancement Module, TEM)을 제안한다.
  • 계층적 구조를 사용하여 다중 척도에서 통계적 텍스처 특징을 캡처하기 위해 피라미드 텍스처 특징 추출 모듈(Pyramid Texture Feature Extraction Module, PTFEM)을 설계한다.
  • QCO, TEM, PTFEM를 종합적으로 통합하여 저수준 및 고수준 특징을 융합하는 엔드 투 엔드 학습 가능한 네트워크를 구축한다.
  • 스킵 연결을 갖춘 표준 인코더-디코더 아키텍처를 사용하며, QCO 기반 모듈을 여러 단계에 삽입하여 텍스처 세부 정보를 유지하고 강화한다.
  • 데이터 증강, 다중 척도 추론, 플립을 활용한 표준 훈련 프로토콜을 적용하여 일반화 능력과 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1지역적 구조 패턴을 초월한 통계적 텍스처 특징은 의미 분할 성능을 향상시킬 수 있는가?
  • RQ2딥 네트워크 내에서 연속적이고 고차원적인 텍스처 분포는 효과적으로 표현되고 최적화될 수 있는가?
  • RQ3학습 가능한 히스토GRAM 기반 메커니즘을 통해 저수준 텍스처 세부 정보를 강화하면 경계 예측 성능이 향상되는가?
  • RQ4다중 척도의 통계적 텍스처 특징은 다양한 데이터셋에서 분할의 강건성과 정확도를 향상시킬 수 있는가?
  • RQ5제안된 방법은 기존 분할 아키텍처와 즉각 통합 가능한 플러그-앤플레이 방식으로 호환되는가?

주요 결과

  • STLNet은 Cityscapes 테스트 세트에서 평균 교차율(mIoU) 82.3%를 기록하며 최신 기술 수준 성능을 달성한다.
  • PASCAL Context 검증 세트에서 STLNet은 mIoU 55.8%를 기록하여 이전 최신 기술 수준 방법보다 뚜렷한 격차로 앞서며 성능을 뛰어넘는다.
  • ADE20K 검증 세트에서 STLNet은 mIoU 46.48%를 달성하여 다양한 시나리오 카테고리에 걸쳐 강력한 일반화 능력을 보여준다.
  • 절단 실험을 통해 텍스처 강화 모듈(TEM)과 피라미드 텍스처 특징 추출 모듈(PTFEM)이 성능 향상에 기여한다는 것이 확인된다.
  • 다중 척도 추론과 테스트 시 플립을 추가함으로써 mIoU가 각각 0.4%와 0.2% 향상되며, 조합 적용 시 최고의 성능을 기록한다.
  • 제안된 모듈(TEM 및 PTFEM)은 추가적인 계산 비용이 극히 적으며, 총 17.48 GFLOPs와 1.31M 파라미터만을 차지하여 효율적이고 실용적인 방법이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.