[논문 리뷰] Simple and Efficient Architectures for Semantic Segmentation
이 논문은 도시경비(시티스케이프)에서 확장된 컨볼루션 없이도 최신 기술 수준의 성능을 달성하는 간단한 인코더-디코더 아키텍처인 FFNet을 제안한다. 이는 기본 블록을 사용하고 경량 다중 스케일 디코더 헤드를 갖춘 ResNet 유사 백본을 사용한다. 이는 HRNet, FANet, DDRNet을 능가하거나 동등하게 성능을 내며, 더 효율적이고 하드웨어 우수성을 갖춘다.
Though the state-of-the architectures for semantic segmentation, such as HRNet, demonstrate impressive accuracy, the complexity arising from their salient design choices hinders a range of model acceleration tools, and further they make use of operations that are inefficient on current hardware. This paper demonstrates that a simple encoder-decoder architecture with a ResNet-like backbone and a small multi-scale head, performs on-par or better than complex semantic segmentation architectures such as HRNet, FANet and DDRNets. Naively applying deep backbones designed for Image Classification to the task of Semantic Segmentation leads to sub-par results, owing to a much smaller effective receptive field of these backbones. Implicit among the various design choices put forth in works like HRNet, DDRNet, and FANet are networks with a large effective receptive field. It is natural to ask if a simple encoder-decoder architecture would compare favorably if comprised of backbones that have a larger effective receptive field, though without the use of inefficient operations like dilated convolutions. We show that with minor and inexpensive modifications to ResNets, enlarging the receptive field, very simple and competitive baselines can be created for Semantic Segmentation. We present a family of such simple architectures for desktop as well as mobile targets, which match or exceed the performance of complex models on the Cityscapes dataset. We hope that our work provides simple yet effective baselines for practitioners to develop efficient semantic segmentation models.
연구 동기 및 목표
- HRNet, FANet, DDRNet과 같은 복잡한 최신 기술 수준의 세그멘테이션 모델을 능가하거나 동등하게 성능을 내는 단순한 인코더-디코더 아키텍처가 가능한지 조사하는 것.
- 기본 블록이 아닌 뱃지너블 블록을 사용하는 표준 ImageNet 미리 훈련된 ResNet을 세그멘테이션에 적용할 때 효율적 수신장이 감소함에 따라 성능 저하가 발생하는 문제를 해결하는 것.
- 더 큰 수신장과 효율적인 연산을 갖춘 단순한 아키텍처가 낮은 계산 비용으로도 높은 정확도를 달성할 수 있는지 보여주는 것.
- 데스크톱 및 모바일 배포에 실용적이고 하드웨어 우수성을 갖춘 기초 모델을 제공하는 것.
제안 방법
- 기본 블록을 사용하고 확장된 컨볼루션 없이 표준 컨볼루션을 사용하는 ResNet 백본을 활용해 경량 FPN 유사 인코더-디코더 아키텍처(FFNet)를 설계한다.
- 확장된 컨볼루션을 표준 컨볼루션으로 대체하고, 대상 플랫폼에 따라 디코더 헤드에서 이중선형 또는 최근접 이웃 보간을 사용한다.
- 백본의 여러 잔차 스테이지에서 특징을 추출하고, 디코더 헤드에서 이들을 융합하여 다중 스케일 특징을 구성한다.
- 다중 스케일 특징에서 최종 세그멘테이션 레이블을 예측하기 위해 작고 전용된 세그멘테이션 헤드를 사용한다.
- 표준 프로토콜을 사용해 시티스케이프 데이터셋에서 모델을 훈련하고 평가하며, 다양한 백본 깊이와 너비에서 성능을 비교한다.
- 확장된 컨볼루션과 같은 하드웨어 비효율적인 연산을 피하고, CPU 및 엣지 디바이스에서 널리 지원되는 연산을 선호함으로써 효율성을 최적화한다.
실험 결과
연구 질문
- RQ1표준 ResNet 백본을 사용하는 단순한 인코더-디코더 아키텍처가 HRNet 및 DDRNet과 같은 복잡한 최신 기술 수준의 모델을 능가하거나 동등하게 성능을 낼 수 있는가?
- RQ2표준 ImageNet 미리 훈련된 ResNet에서 뱃지너블 블록을 사용하면 효율적 수신장이 감소함에 따라 세그멘테이션 성능에 제한이 생기는가?
- RQ3기본 블록을 사용하고 확장된 컨볼루션 없이도 경쟁력 있는 정확도를 달성하면서도 더 효율적이고 엣지 디바이스에서 배포 가능한가?
- RQ4동일한 아키텍처 패밀리 내에서 표준 ImageNet 미리 훈련된 모델과 작업 전용 아키텍처 간에 성능 격차가 존재하는가?
주요 결과
- 기본 블록을 사용하는 ResNet 백본을 갖춘 FFNet 모델은 시티스케이프 검증 세트에서 HRNet, FANet, DDRNet과 비교해 유사하거나 더 높은 성능을 기록한다.
- C-C-C 헤드를 갖춘 ResNet-122 NS 모델은 시티스케이프에서 78.7%의 평균 IoU를 달성하여 여러 복잡한 아키텍처를 능가한다.
- 뱃지너블 블록 대신 기본 블록을 사용함으로써 효율적 수신장이 증가하여 표준 ResNet 백본보다 유의미하게 성능 향상을 이룬다.
- 모든 FFNet 모델은 확장된 컨볼루션을 사용하지 않으며, 오직 표준이고 하드웨어 효율적인 연산만을 사용하여 더 빠른 추론과 더 쉬운 현장 배포를 가능하게 한다.
- 최근접 이웃 보간과 좁은 너비를 사용하는 모바일 최적화된 FFNet 변종은 낮은 FLOPs(12.0 GFLOPs)로 높은 정확도(예: 76.5% IoU)를 달성하여 엣지 디바이스에 적합하다.
- FFNet 메타아키텍처의 단순성 덕분에 신경망 아키텍처 탐색(NAS) 파이프라인에 간편하게 통합될 수 있으며, 향후 효율 중심의 모델 탐색을 위한 강력한 기초 모델이 된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.