Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Implicit Feature Alignment Function for Semantic Segmentation

Hanzhe Hu, Yinbo Chen|arXiv (Cornell University)|2022. 06. 17.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 이중선형 보간 또는 복잡한 컨볼루션을 사용하지 않고 다중 수준 특징 맵을 세분화 분류에서 정렬하기 위해 암시적 신경 표현을 사용하는 새로운 방법인 암묵적 특징 정렬(IFA)을 제안한다. 특징을 연속적인 공간 분야로 간주함으로써 IFA는 상대 좌표를 사용해 근처 특징을 쿼리하는 다층 퍼셉트론(MLP)을 통해 해상도에 구애받지 않는 정밀하고 효율적인 특징 집합을 가능하게 하며, Cityscapes, PASCAL Context, ADE20K에서 최신 기준 성능을 달성한다.

ABSTRACT

Integrating high-level context information with low-level details is of central importance in semantic segmentation. Towards this end, most existing segmentation models apply bilinear up-sampling and convolutions to feature maps of different scales, and then align them at the same resolution. However, bilinear up-sampling blurs the precise information learned in these feature maps and convolutions incur extra computation costs. To address these issues, we propose the Implicit Feature Alignment function (IFA). Our method is inspired by the rapidly expanding topic of implicit neural representations, where coordinate-based neural networks are used to designate fields of signals. In IFA, feature vectors are viewed as representing a 2D field of information. Given a query coordinate, nearby feature vectors with their relative coordinates are taken from the multi-level feature maps and then fed into an MLP to generate the corresponding output. As such, IFA implicitly aligns the feature maps at different levels and is capable of producing segmentation maps in arbitrary resolutions. We demonstrate the efficacy of IFA on multiple datasets, including Cityscapes, PASCAL Context, and ADE20K. Our method can be combined with improvement on various architectures, and it achieves state-of-the-art computation-accuracy trade-off on common benchmarks. Code will be made available at https://github.com/hzhupku/IFA.

연구 동기 및 목표

  • 세분화 분류에서 이중선형 보간 및 컨볼루션 기반 특징 정렬의 비효율성과 부정확성을 해결한다.
  • 특히 고수준 및 저수준 특징 간 해상도 차이가 클 경우 발생하는 고정 해상도 특징 정렬의 한계를 극복한다.
  • 암묵적 신경 표현을 사용해 다중 수준 특징을 연속적인 분야로 모델링함으로써 정밀하고 해상도에 구애받지 않는 특징 집합을 가능하게 한다.
  • 특히 고해상도 세분화 및 엣지 배포 환경에서 계산 효율성과 메모리 사용량을 향상시킨다.
  • 다양한 벤치마크에서 기존 최신 기술 대비 더 나은 정확도-계산량 트레이드오프를 달성한다.

제안 방법

  • 다중 수준 특징 맵을 공간 상의 잠재 코드로 표현하는 연속적인 2차원 분야로 간주한다.
  • 임의의 쿼리 좌표에 대해 해당 점에서의 상대 공간 오프셋과 함께 다양한 수준의 근접 특징 벡터를 추출한다.
  • 결합된 특징 벡터와 상대 좌표를 다층 퍼셉트론(MLP)에 입력하여 쿼리 점에서의 정렬된 특징 값을 예측한다.
  • 고정 해상도 보간 없이도 임의의 해상도 추론을 가능하게 하여 해상도에 구애받지 않는 기능을 제공한다.
  • FPN와 같은 아키텍처의 표준 이중선형 보간 및 컨볼루션 정렬 모듈을 IFA 모듈로 대체하여 엔드 투 엔드 통합을 가능하게 한다.
  • 다양한 백본 아키텍처와 통합하고, 필요에 따라 맥락 모델링을 위한 ASPP 모듈을 추가함으로써 높은 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1암묵적 신경 표현이 세분화 분류의 특징 정렬에 효과적으로 적용되어 정밀도와 효율성을 향상시킬 수 있는가?
  • RQ2IFA는 정확도와 계산 비용 측면에서 이중선형 보간 및 컨볼루션 기반 정렬보다 어떻게 성능을 내는가?
  • RQ3특징 맵 간 해상도 간격이 클 경우 IFA는 성능을 유지하거나 향상시키는가?
  • RQ4기존 세분화 아키텍처에 구조적 개조 없이 IFA를 원활하게 통합할 수 있는가?
  • RQ5Cityscapes, PASCAL Context, ADE20K와 같은 다양한 벤치마크에서 IFA는 정확도-계산량 트레이드오프에 어떤 영향을 미치는가?

주요 결과

  • Cityscapes 테스트 세트에서 IFA는 82.0 mIoU를 달성하여 SFNet(81.8)을 뛰어넘지만, 계산 비용은 61%에 불과하고 SegFormer보다도 32% 적은 파rameter를 사용한다.
  • PASCAL Context에서 IFA는 63.5 GFLOPs로 53.8% mIoU를 달성하여 SFNet(53.8% mIoU)을 능가하지만, 계산량은 61%에 그친다.
  • ADE20K에서 IFA는 72.0 GFLOPs로 45.98% mIoU를 달성하여 CPNet(46.27% mIoU)를 뛰어넘지만, 계산 비용은 단지 22%에 불과하다.
  • IFA는 SFNet 대비 계산 비용을 최대 57%까지 줄였지만 정확도를 유지하거나 향상시켜 뛰어난 효율성을 입증한다.
  • 특징 간 해상도 차이가 클 경우 IFA는 더 큰 성능 향상을 보이며, 고해상도 세분화에서의 효과성을 확인한다.
  • IFA에 ASPP 모듈을 추가하면 성능이 추가로 향상되어, 기존 맥락 모델링 기법과의 호환성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.