Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Semantic Segmentation via Dilated Affinity

Boxi Wu, Shuai Zhao|arXiv (Cornell University)|2019. 07. 16.
Advanced Neural Network Applications참고 문헌 26인용 수 4
한 줄 요약

이 논문은 희박하고 구조적인 픽셀 간 유사도를 동시에 예측하도록 네트워크를 공동으로 훈련시켜 의미 분할 성능을 햖थ하는 단순하면서도 효과적인 방법인 확장된 유사도(dilated affinity)를 제안한다. 픽셀 간 장거리이고 구조적인 관계를 포괄하는 확장된 유사도로 모델을 직접적으로 지도함으로써 특징 표현이 향상되고, 유사도 전파를 통한 빠른 후처리 보정이 가능해져, 계산 비용을 최소화하면서도 PASCAL VOC 2012 및 Cityscapes에서 최신 기준 성능을 달성한다.

ABSTRACT

Introducing explicit constraints on the structural predictions has been an effective way to improve the performance of semantic segmentation models. Existing methods are mainly based on insufficient hand-crafted rules that only partially capture the image structure, and some methods can also suffer from the efficiency issue. As a result, most of the state-of-the-art fully convolutional networks did not adopt these techniques. In this work, we propose a simple, fast yet effective method that exploits structural information through direct supervision with minor additional expense. To be specific, our method explicitly requires the network to predict semantic segmentation as well as dilated affinity, which is a sparse version of pair-wise pixel affinity. The capability of telling the relationships between pixels are directly built into the model and enhance the quality of segmentation in two stages. 1) Joint training with dilated affinity can provide robust feature representations and thus lead to finer segmentation results. 2) The extra output of affinity information can be further utilized to refine the original segmentation with a fast propagation process. Consistent improvements are observed on various benchmark datasets when applying our framework to the existing state-of-the-art model. Codes will be released soon.

연구 동기 및 목표

  • 의미 분할에 히وري스틱하고 수작업으로 설계된 구조적 사전 지식에 의존하는 기존 방법의 한계를 해결하기 위해.
  • 직접적인 지도 학습을 통해 픽셀 간의 구조적 관계를 명시적으로 모델링하여 분할 성능을 향상시키기 위해.
  • 추가 애너테이션이나 복잡한 후처리가 필요 없이 훈련과 추론 모두를 효율적으로 향상시키는 경량의 방법을 개발하기 위해.
  • 확장된 유사도를 통한 구조적 인덕티브 바이어스 통합을 통해 다양한 벤치마크에서 일관된 성능 향상을 달성하기 위해.

제안 방법

  • 이 방법은 의미 분할과 확장된 유사도를 동시에 예측하는 이중 헤드 네트워크를 도입한다. 확장된 유사도는 쌍방향 픽셀 유사도의 희박하고 구조적인 형태이다.
  • 확장된 유사도는 중심 픽셀과 여러 전략적으로 선택된 확장 비율(dilation rates, 예: 8, 16, 32, 64)을 가진 이웃 픽셀 간에 계산되며, 국소성은 유지하면서 장거리 의존성을 포착한다.
  • 모델은 병합된 손실 함수로 훈련되며, 의미 분할에 대한 교차 엔트로피 손실과 유사도 예측에 대한 가중 손실이 포함된다. 가중치 설정(예: 제곱근 재가중)은 교차 검증을 통해 최적화된다.
  • 훈련 후, 예측된 유사도 맵은 빠르고 반복적인 유사도 전파 과정에 사용되어 초기 분할 예측을 보정한다.
  • 전파 단계는 예측된 유사도의 구조적 일관성을 활용하여 노이즈가 많은 예측을 매끄럽게 하고 객체 경계를 명확히 한다.
  • 기존 최신 기술 모델들(예: DeepLabv3+)과 호환되며, 아키텍처 수정이 미미하고 추가 계산 비용이 거의 없다.

실험 결과

연구 질문

  • RQ1픽셀 간 구조적 관계에 대한 명시적 지도 학습이 의미 분할 성능 향상에 기여하는가?
  • RQ2확장된 유사도가 의미 있는 이미지 구조를 포착하는 데서 밀도 있는 CRF나 히وري스틱 손실 재가중 기법보다 어떻게 다를까?
  • RQ3유사도 학습과 전파에 최적화된 확장 비율 조합과 가중치 설정은 무엇인가?
  • RQ4예측된 유사도 맵은 효율적인 후처리 방식으로 분할 결과를 효과적으로 개선하는 데 사용될 수 있는가?
  • RQ5의미 분할과 유사도의 공동 훈련이 표준 훈련만으로는 달성할 수 없는 더 나은 특징 표현을 만들어내는가?

주요 결과

  • PASCAL VOC 2012에서 제안된 방법은 평균 교차율(mIoU) 79.21%를 달성하여 베이스라인인 DeepLabv3+보다 1.28%p 높은 성능을 보였다.
  • Cityscapes에서의 성능은 베이스라인 77.15%에서 78.70%로 향상되어 다양한 데이터셋에서 일관된 성능 향상을 입증했다.
  • 10회 반복 동안 예측된 유사도 맵을 활용한 유사도 전파 과정에서 mIoU가 78.62%에서 79.21%로 향상되어 보정의 효과를 입증했다.
  • 정답 유사도 맵을 사용한 전파에서는 더 높은 성능(83.59% mIoU)을 기록하여, 예측된 유사도가 유의미한 구조적 정보를 담고 있음을 확인했다.
  • 특히 큰 확장 비율에서, 제곱근 재가중 방식이 이웃 픽셀 재가중 방식보다 우수한 성능을 보였다.
  • 최고의 성능는 {8, (12,24), 16}의 조합에서 달성되었으며, 이는 다중 척도이자 비대칭적인 수신장이 다양한 구조적 패턴을 포착하는 데 유리함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.