Skip to main content
QUICK REVIEW

[논문 리뷰] Class-wise Dynamic Graph Convolution for Semantic Segmentation

Hanzhe Hu, Deyi Ji|arXiv (Cornell University)|2020. 07. 19.
Advanced Neural Network Applications참고 문헌 42인용 수 16
한 줄 요약

이 논문은 계층별 동적 그래프 컨볼루션(CDGC)이라는 새로운 모듈을 제안하며, 굵은 예측에서 계층별 그래프를 구성하고, 적응형으로 하드한 양성 및 음성 샘플을 동적으로 샘플링하여 맥락 인식 기반의 특징 집합을 향상시킨다. CDGCNet은 이 모듈을 기반으로 구축되어 Cityscapes(82.0% mIOU), PASCAL VOC 2012(83.9% mIOU), COCO Stuff(40.7% mIOU)에서 최신 기술 수준을 달성하며, 경계 유지 및 맥락적 추론 능력에서 뛰어난 성능을 보여준다.

ABSTRACT

Recent works have made great progress in semantic segmentation by exploiting contextual information in a local or global manner with dilated convolutions, pyramid pooling or self-attention mechanism. In order to avoid potential misleading contextual information aggregation in previous works, we propose a class-wise dynamic graph convolution (CDGC) module to adaptively propagate information. The graph reasoning is performed among pixels in the same class. Based on the proposed CDGC module, we further introduce the Class-wise Dynamic Graph Convolution Network(CDGCNet), which consists of two main parts including the CDGC module and a basic segmentation network, forming a coarse-to-fine paradigm. Specifically, the CDGC module takes the coarse segmentation result as class mask to extract node features for graph construction and performs dynamic graph convolutions on the constructed graph to learn the feature aggregation and weight allocation. Then the refined feature and the original feature are fused to get the final prediction. We conduct extensive experiments on three popular semantic segmentation benchmarks including Cityscapes, PASCAL VOC 2012 and COCO Stuff, and achieve state-of-the-art performance on all three benchmarks.

연구 동기 및 목표

  • 픽셀 단위의 의미 분할을 위한 장거리 맥락 정보 집합의 기존 방법의 한계를 해결한다.
  • 의미적으로 다를 수 있는 영역에서 특징을 무분별하게 집합함으로써 발생하는 특징 학습의 비구분성 문제를 해결한다.
  • 어려운 샘플에 초점을 맞추는 계층별 동적 그래프 구조를 활용해 특징 표현을 향상시킨다.
  • 그래프 기반 특징 보정을 통해 초기 예측을 개선하는 계층적-세밀한 프레임워크를 개발한다.
  • 향상된 맥락 모델링과 경계 유지 능력을 통해 주요 벤치마크에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 粗역 분할 예측을 계층 마스크로 사용하여 각 의미 계층별로 노드 특징을 추출함으로써 계층별 그래프를 구성한다.
  • 특징 유사도에 기반해 적응적으로 학습되는 에지 가중치를 갖는 각 계층별 그래프에서 동적 그래프 컨볼루션을 수행한다.
  • 어려운 픽셀에 초점을 맞추기 위해 그래프 구축 과정에 하드한 양성 및 음성 샘플을 통합한다.
  • 이중 브랜치 특징 보정 메커니즘을 사용한다: 그래프 컨볼루션을 통해 원본 특징맵을 보정하고, 이를 원본 특징과 융합하여 최종 예측을 도출한다.
  • 기본 분할 네트워크(예: ResNet-101 + ASPP)에 CDGC 모듈을 계층적-세밀한 프레임워크에서 통합한다.
  • 추론 과정에서 다중 스케일 및 플립 증강을 적용하여 성능을 추가로 향상시킨다.

실험 결과

연구 질문

  • RQ1계층별 그래프 구축이 의미 분할에서 장거리 맥락적 추론을 향상시키는가?
  • RQ2균일하거나 고정된 샘플링 방식에 비해 하드한 양성 및 음성 샘플의 동적 샘플링이 특징 학습을 향상시키는가?
  • RQ3전반적인 자기주의 주의 또는 표준 GCN에 비해 계층별 그래프 컨볼루션은 특징의 구분력과 경계 정확도 측면에서 어떻게 비교되는가?
  • RQ4그래프 보정을 통한 계층적-세밀한 프레임워크가 표준 벤치마크에서 mIOU를 얼마나 향상시키는가?
  • RQ5복잡한 도시 및 혼잡한 환경에서 하드 샘플 마이닝의 기여도는 얼마나 큰가?

주요 결과

  • CDGCNet은 Cityscapes 검증 세트에서 82.0% mIOU를 달성하여 이전 최신 기술 수준의 방법들을 초월한다.
  • PASCAL VOC 2012에서 CDGCNet은 83.9% mIOU를 기록하며, 비교에 포함된 모든 이전 방법들을 능가한다.
  • COCO Stuff에서 CDGCNet은 40.7% mIOU를 달성하여 이 도전적인 데이터셋에서 새로운 최신 기술 수준의 성능을 수립한다.
  • 절단 실험 결과, 하드 음성 샘플을 포함시킴으로써 Cityscapes에서 mIOU가 80.5%에서 81.1%로 향상됨을 확인하였다.
  • 시각화 결과, CDGC 모듈이 특히 객체 경계에서 어려운 샘플을 효과적으로 해결하며 세밀한 세부 정보를 유지함을 보여준다.
  • 다중 스케일 및 플립 증강의 조합은 Cityscapes에서 성능을 0.8% 향상시켜, 이 방법의 강건성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.