Skip to main content
QUICK REVIEW

[논문 리뷰] A Unified Efficient Pyramid Transformer for Semantic Segmentation

Fangrui Zhu, Yi Zhu|arXiv (Cornell University)|2021. 07. 29.
Advanced Neural Network Applications참고 문헌 71인용 수 4
한 줄 요약

이 논문은 의미 분할을 위한 통합적이고 효율적인 트랜스포머 기반 프레임워크인 UN-EPT를 제안한다. 이는 장거리 컨텍스트 모델링과 경계 정밀 조정을 동시에 최적화한다. 피라미드 트랜스포머에서 희소 샘플링 전략을 활용해 장거리 컨텍스트를 확보하고, 경계 세부 정보를 위한 경량 공간 브랜치를 도입함으로써, UN-EPT는 단지 8.5GB의 GPU 메모리만을 사용하여 ADE20K에서 SOTA mIoU 50.5를 달성한다. 이는 더 큰 모델과 높은 메모리 비용을 요구하는 기존 방법들보다 뛰어난 성능을 발휘한다.

ABSTRACT

Semantic segmentation is a challenging problem due to difficulties in modeling context in complex scenes and class confusions along boundaries. Most literature either focuses on context modeling or boundary refinement, which is less generalizable in open-world scenarios. In this work, we advocate a unified framework(UN-EPT) to segment objects by considering both context information and boundary artifacts. We first adapt a sparse sampling strategy to incorporate the transformer-based attention mechanism for efficient context modeling. In addition, a separate spatial branch is introduced to capture image details for boundary refinement. The whole model can be trained in an end-to-end manner. We demonstrate promising performance on three popular benchmarks for semantic segmentation with low memory footprint. Code will be released soon.

연구 동기 및 목표

  • 기존 의미 분할 방법들이 컨텍스트 모델링 또는 경계 정밀 조정 중 하나에만 집중함으로써 개방형 환경에서 최적의 성능을 내지 못하는 한계를 해결하기 위해.
  • 복잡한 환경에서 전역적 컨텍스트 이해를 향상시키고 객체 경계를 정밀 조정하는 통합 프레임워크를 개발하기 위해.
  • 의미 분할과 같은 조밀한 예측 작업에서 표준 트랜스포머의 높은 메모리 및 계산 비용을 줄이기 위해.
  • 다중 척도 컨텍스트 특징과 세밀한 공간적 세부 정보를 효과적으로 조합할 수 있는 엔드 투 엔드 학습이 가능한 모델을 구현하기 위해.
  • 대규모 사전 학습 없이도 최소한의 메모리 프로파일을 유지하면서 SOTA 성능을 달성하기 위해.

제안 방법

  • 고해상도 특징 맵을 효율적으로 처리할 수 있도록, 주로 주의 메커니즘의 계산량과 메모리 사용량을 줄이기 위해 트랜스포머 기반 디코더에 희소 샘플링 전략을 도입한다.
  • 백본 네트워크에서 유도된 다중 척도 특징을 활용해 다양한 수용장역을 가진 컨텍스트 표현을 풍부하게 하는 효율적인 피라미드 트랜스포머(EPT) 모듈을 제안한다.
  • 로컬 이미지 세부 정보를 캡처하고 분할 경계를 정밀 조정하기 위해, 3층의 백본과 두 개의 헤드를 갖춘 별도의 공간 브랜치를 설계한다.
  • 공간 브랜치에서 추출한 특징을 트랜스포머 디코더의 입력-적응형 쿼리로 사용하여, 로컬 이미지 콘텐츠에 기반한 동적 컨텍스트 모델링을 가능하게 한다.
  • 컨텍스트 브랜치(EPT)와 공간 브랜치를 통합하여 엔드 투 엔드 학습이 가능한 통합 네트워크(UN-EPT)로 조합함으로써, 분할 품질과 경계 정확도를 동시에 최적화한다.
  • 입력은 이미지 픽셀의 평탄화된 시퀀스이고 출력은 클래스 레이블의 시퀀스인 세트 예측 설정을 사용하여, 트랜스포머 기반의 시퀀스-투-시퀀스 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1통합적인 딥 러닝 프레임워크가 효율성을 희생시키지 않고 의미 분할에서 컨텍스트 모델링과 경계 정밀 조정을 효과적으로 균형 있게 조율할 수 있는가?
  • RQ2어떻게 하면 자기주의 주의 메커니즘을 고해상도 입력을 처리할 수 있도록 계산적으로 효율적으로 만들 수 있는가?
  • RQ3다중 척도 특징 융합과 희소 주의가 복잡한 환경에서 장거리 의존성을 모델링하는 데 미치는 영향은 무엇인가?
  • RQ4경량 공간 브랜치는 모델 복잡도를 증가시키지 않으면서 경계 정렬 정확도를 얼마나 향상시킬 수 있는가?
  • RQ5기존 방법들과 비교해 상당히 감소된 메모리 소비로 트랜스포머 기반 아키텍처가 SOTA 성능을 달성할 수 있는가?

주요 결과

  • DeiT를 백본으로 사용할 경우, UN-EPT는 ADE20K 벤치마크에서 mIoU 50.5를 달성하여 동일한 아키텍처를 가진 기존 방법들을 능가한다.
  • ResNet50를 백본으로 사용할 경우, UN-EPT는 ADE20K에서 mIoU 46.1을 기록하여 대규모 사전 학습 없이도 뛰어난 성능을 보여준다.
  • 학습 중에 단지 8.5GB의 GPU 메모리만을 요구하여, SETR(30.0GB) 및 기타 트랜스포머 기반 모델보다 크게 낮은 메모리 사용량을 기록한다.
  • 제거 실험 결과, 공간 브랜치가 mIoU를 1.1점 향상시켜 경계 정밀 조정의 효과성을 입증한다.
  • 피라미드 레벨의 각 특징 맵에 대해 16개의 샘플링 포인트를 사용할 경우 최적의 성능를 달성하며, 이 이상의 포인트 수를 늘려도 성능 향상에 미미한 영향을 미친다.
  • 비교된 모든 방법들 중에서 가장 낮은 GFLOPs(99.1)를 기록하여 높은 계산 효율성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.