Skip to main content
QUICK REVIEW

[논문 리뷰] Semantic Flow for Fast and Accurate Scene Parsing

Xiangtai Li, Ansheng You|arXiv (Cornell University)|2020. 02. 24.
Advanced Neural Network Applications참고 문헌 73인용 수 16
한 줄 요약

이 논문은 시나리오 분석에서 고해상도 특징 맵으로 고수준 의미적 특징을 효율적으로 전달하기 위해 의미 흐름(Semantic Flow)과 플로우 정렬 모듈(FAM)을 제안한다. 실시간 추론을 통해 최신 기준 성능을 달성한다. ResNet-18를 사용하여 Cityscapes에서 26 FPS에서 80.4% mIoU를 달성하며, 이는 이전 실시간 모델을 능가하는 성능을 보이며 낮은 계산 비용을 유지한다.

ABSTRACT

In this paper, we focus on designing effective method for fast and accurate scene parsing. A common practice to improve the performance is to attain high resolution feature maps with strong semantic representation. Two strategies are widely used -- atrous convolutions and feature pyramid fusion, are either computation intensive or ineffective. Inspired by the Optical Flow for motion alignment between adjacent video frames, we propose a Flow Alignment Module (FAM) to learn Semantic Flow between feature maps of adjacent levels, and broadcast high-level features to high resolution features effectively and efficiently. Furthermore, integrating our module to a common feature pyramid structure exhibits superior performance over other real-time methods even on light-weight backbone networks, such as ResNet-18. Extensive experiments are conducted on several challenging datasets, including Cityscapes, PASCAL Context, ADE20K and CamVid. Especially, our network is the first to achieve 80.4\% mIoU on Cityscapes with a frame rate of 26 FPS. The code is available at \url{https://github.com/lxtGH/SFSegNets}.

연구 동기 및 목표

  • 시나리오 분석에서 고해상도 공간적 세부 정보와 강력한 의미 표현 간의 상충 관계를 해결하기 위해.
  • 실시간 의미 분할에서 정확도를 향상시키면서도 계산 비용을 줄이기 위해.
  • 높은 계산 비용 없이도 깊은 층에서 浅층으로 의미 특징을 효과적으로 전파하기 위해.
  • ResNet-18와 같은 경량 기반 모델을 향상시키는 즉시 사용 가능한 모듈을 설계하기 위해.
  • 다양한 벤치마크 데이터셋에서 뛰어난 속도-정확도 상충 관계를 달성하기 위해.

제안 방법

  • 다른 해상도의 특징 맵 간의 픽셀 단위 대응을 모델링하는 가속 가능한 흐름 필드로 의미 흐름(Semantic Flow)을 제안한다.
  • 학습된 의미 흐름을 사용해 고수준 특징을 저해상도 특징 맵으로 워핑하기 위해 플로우 정렬 모듈(FAM)을 도입한다.
  • 가속 가능한 워핑을 사용한 격자 샘플링을 통해 특징을 효율적으로 정렬하고, 엔드 투 엔드 학습을 가능하게 한다.
  • 다중 해상도 특징 융합을 위한 옆으로 연결된 루프(라테럴 커넥션)가 있는 특징 피라미드 네트워크(FPN-유사)에 FAM를 통합한다.
  • 내성성과 테스트 세트에서의 mIoU 향상을 위해 수평 뒤집기와 함께 다중 해상도 추론을 사용한다.
  • 단일 GPU 환경에서 추론 속도 최적화를 위해 TensorRT와 CUDA 최적화 연산자를 사용한다.

실험 결과

연구 질문

  • RQ1학습 가능한 플로우 기반 메커니즘이 계산 비용을 증가시키지 않고도 깊은 특징에서 얕은 특징으로 의미 지식을 효과적으로 전달할 수 있는가?
  • RQ2FAM가 ResNet-18와 같은 경량 기반 모델에서 실시간 추론 속도를 유지하면서 성능을 향상시킬 수 있는가?
  • RQ3의미 흐름이 정확도와 효율성 측면에서 전통적인 아트로우 컨볼루션과 특징 피라미드 융합보다 뛰어나게 성능을 내는가?
  • RQ4제안된 방법이 Cityscapes, PASCAL Context, ADE20K, CamVid와 같은 다양한 데이터셋에 일반화 가능한가?
  • RQ5제안된 방법의 속도-정확도 상충 관계가 기존 실시간 시나리오 분석 모델보다 뛰어난가?

주요 결과

  • ResNet-18를 사용한 SFNet은 Cityscapes 테스트 세트에서 26 FPS에서 80.4% mIoU를 달성하여 실시간 모델 중 최신 기준 성능을 수립한다.
  • DF2 기반 모델을 사용할 경우, SFNet은 61 FPS에서 77.8% mIoU, 121 FPS에서 74.5% mIoU를 기록하여 강력한 속도-정확도 균형을 보여준다.
  • ResNet-101을 사용할 경우, SFNet은 81.8% mIoU를 달성하며, DANet(81.5%)을 뛰어넘지만 추론 계산량은 그의 33%에 불과하다.
  • FAM는 기준 모델 대비 Cityscapes 검증 세트에서 mIoU를 2.2% 향상시키며, 모든 카테고리에서 일관된 성능 향상을 보였다.
  • ADE20K와 PASCAL Context에서 SFNet은 최소한의 계산 오버헤드로 경쟁 가능한 mIoU를 달성하여 광범위한 적용 가능성을 보였다.
  • Cityscapes에서 최신 기준 모델인 PSPNet, DenseASPP, BFPNet과 비교해 SFNet은 정확도와 GFLOPs 효율성 측면에서 모두 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.