Skip to main content
QUICK REVIEW

[논문 리뷰] Feature Pyramid Transformer

Dong Zhang, Hanwang Zhang|arXiv (Cornell University)|2020. 07. 18.
Advanced Neural Network Applications참고 문헌 47인용 수 7
한 줄 요약

이 논문은 공간적 차원과 스케일 차원에서 비국소적이고 교차 스케일 상호작용을 명시적으로 모델링함으로써 특징 피라미드를 향상시키는 새로운 자기주의 기반 모듈인 특징 피라미드 트랜스포머(FPT)를 제안한다. 자기 수준, 상향식, 하향식 트랜스포머를 통합함으로써 FPT는 최소한의 계산 부담으로 객체 검출 및 세분화 성능을 향상시키며, 다양한 벤치마크에서 최신 기술 수준(mIoU)을 1.6–1.8% 향상시킨다.

ABSTRACT

Feature interactions across space and scales underpin modern visual recognition systems because they introduce beneficial visual contexts. Conventionally, spatial contexts are passively hidden in the CNN's increasing receptive fields or actively encoded by non-local convolution. Yet, the non-local spatial interactions are not across scales, and thus they fail to capture the non-local contexts of objects (or parts) residing in different scales. To this end, we propose a fully active feature interaction across both space and scales, called Feature Pyramid Transformer (FPT). It transforms any feature pyramid into another feature pyramid of the same size but with richer contexts, by using three specially designed transformers in self-level, top-down, and bottom-up interaction fashion. FPT serves as a generic visual backbone with fair computational overhead. We conduct extensive experiments in both instance-level (i.e., object detection and instance segmentation) and pixel-level segmentation tasks, using various backbones and head networks, and observe consistent improvement over all the baselines and the state-of-the-art methods.

연구 동기 및 목표

  • 기존 방법이 특징 피라미드 내에서 비국소적이고 교차 스케일 시각적 맥락을 포착하는 데에 한계가 있음을 해결하기 위해.
  • 기존의 컨volution 네트워크(CNN)를 초월해 공간적 및 스케일 인식 특징 상호작용을 능동적으로 모델링하는 일반적이고 즉시 사용 가능한 백본을 설계하기 위해.
  • 더 풍부한 맥락적 특징 표현을 통해 인스턴스 수준(객체 검출, 인스턴스 세분화) 및 픽셀 수준(세분화) 작업의 성능을 향상시키기 위해.
  • 다양한 시각 인식 작업에서 특징 표현 품질을 크게 향상시키면서도 계산 효율성을 유지하기 위해.

제안 방법

  • 입력 특징 피라미드를 동일한 크기의 더 풍부하고 맥락적으로 향상된 특징 피라미드로 변환하는 특징 피라미드 트랜스포머(FPT)를 제안한다.
  • 세 가지 전문화된 트랜스포머를 도입한다: 수준 내 공간 상호작용을 위한 자기 트랜스포머(ST), 상향식 스케일 인식 상호작용을 위한 국소-전역 트랜스포머(LGT), 하향식 스케일 인식 상호작용을 위한 표현 트랜스포머(RT).
  • 학습 가능한 쿼리, 키, 밸류를 사용한 멀티헤드 자기주의 메커니즘을 활용하여 공간적 및 스케일적 차원을 넘어선 장거리 비국소적 의존성을 명시적으로 모델링한다.
  • 프로세스 전반에 걸쳐 특징 맵의 해상도와 크기를 유지함으로써 기존의 검출 및 세분화 헤드와의 원활한 통합을 가능하게 한다.
  • 제어된 FLOPs와 파라미터 증가를 고려한 경량 설계를 적용함으로써 공정한 계산 부담을 확보한다(예: LGT에 대해 +0.44× 파라미터, +0.10× GFLOPs).
  • 다양한 백본(예: ResNet-101)과 특징 피라미드 아키텍처(UFP, PPM, ASPP) 위에 FPT를 일반 모듈로 적용하여 광범위한 호환성을 입증한다.

실험 결과

연구 질문

  • RQ1명시적인 교차 스케일 특징 상호작용이 기존의 CNN 기반 또는 비국소적 공간 전용 방법을 초월해 시각 인식 성능을 향상시킬 수 있는가?
  • RQ2자기주의 메커니즘은 공간적 차원뿐 아니라 다양한 특징 피라미드 수준 간의 비국소적 상호작용을 어떻게 모델링할 수 있는가?
  • RQ3FPT는 최신 기술 수준의 방법과 비교해 인스턴스 수준 및 픽셀 수준의 세분화 작업에서 얼마나 성능을 향상시키는가?
  • RQ4다양한 벤치마크 및 백본 아키텍처에서 FPT는 특징 표현 품질을 크게 향상시키면서도 높은 효율성을 유지할 수 있는가?

주요 결과

  • FPT는 Cityscapes, ADE20K, LIP, PASCAL VOC 2012에서 최신 기술 수준의 성능를 달성하였으며, 동일한 ResNet-101 백본을 사용한 이전 최신 기술 수준 방법 대비 각각 mIoU를 1.6%, 1.2%, 1.7%, 1.8% 향상시켰다.
  • 제거 분석 결과, 세 트랜스포머(ST, LGT, RT)를 모두 조합할 경우 최고의 성능를 기록하였으며, Cityscapes에서 UFP 기준으로 2.6% 높은 검증 mIoU를 달성하였다.
  • 자기 트랜스포머(ST)만으로도 UFP 대비 검증 mIoU가 1.6% 향상되어 수준 내 비국소적 상호작용의 효과를 입증하였다.
  • FPT는 최신 기술 수준의 OCNet보다 각각 Cityscapes, ADE20K, LIP, PASCAL VOC 2012에서 mIoU를 0.9%, 1.1%, 1.3%, 0.8% 향상시켰다.
  • 정성적 결과에서는 FPT가 기준 모델 및 OCNet 대비 더 정밀한 경계 예측과 작은, 얇은 물체(예: 경비원의 경계선, 사람의 다리)에 대한 더 나은 세분화를 제공하는 것으로 나타났다.
  • 모델은 공정한 계산 비용을 유지하며, UFP 기준으로 최대 0.44×의 파라미터 증가 및 최대 0.10×의 GFLOPs 증가를 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.