Skip to main content
QUICK REVIEW

[논문 리뷰] Masked-attention Mask Transformer for Universal Image Segmentation

Bowen Cheng, Ishan Misra|arXiv (Cornell University)|2021. 12. 02.
Advanced Neural Network Applications참고 문헌 57인용 수 127
한 줄 요약

Mask2Former은 마스크된 주의력을 사용하는 보편적 이미지 분할 아키텍처로, 파노픽, 인스턴스 및 시맨틱 과제에서 여러 데이터셋에 걸쳐 전문 모델보다 우수하며, 학습 효율이 개선됩니다.

ABSTRACT

Image segmentation is about grouping pixels with different semantics, e.g., category or instance membership, where each choice of semantics defines a task. While only the semantics of each task differ, current research focuses on designing specialized architectures for each task. We present Masked-attention Mask Transformer (Mask2Former), a new architecture capable of addressing any image segmentation task (panoptic, instance or semantic). Its key components include masked attention, which extracts localized features by constraining cross-attention within predicted mask regions. In addition to reducing the research effort by at least three times, it outperforms the best specialized architectures by a significant margin on four popular datasets. Most notably, Mask2Former sets a new state-of-the-art for panoptic segmentation (57.8 PQ on COCO), instance segmentation (50.1 AP on COCO) and semantic segmentation (57.7 mIoU on ADE20K).

연구 동기 및 목표

  • 단일 설계로 파노픽, 인스턴스, 시맨틱 작업을 모두 처리할 수 있는 보편적 분할 아키텍처를 제안한다.
  • 다중 분할 작업에서 단일 모델이 우수하게 작동할 수 있음을 보여주어 시스템 통합의 단편화를 제거한다.
  • 정확도를 희생하지 않으면서 보편적 분할의 학습 효율성과 접근성을 개선한다.
  • 마스크된 주의력과 다중 스케일 고해상도 특징이 수렴성과 성능을 향상시킨다는 것을 입증한다.
  • 작업 간 이득을 주도하는 구성 요소를 이해하기 위한 어블레이션을 제공한다.

제안 방법

  • 마스크 쿼리에 작동하는 백본, 픽셀 디코더, 트랜스포머 디코더를 갖춘 메타 아키텍처를 도입한다.
  • 표준 크로스 어텐션을 예측된 마스크 영역 내에서만 주의하는 마스크드 어텐션으로 교체한다.
  • 작은 물체를 더 잘 분할하기 위해 다중 스케일의 고해상도 특징 전략을 사용한다.
  • 자기- 및 교차 어텐션의 순서를 재배열하고, 쿼리 특징을 학습 가능하게 하며, 드롭아웃을 제거하는 최적화 변경을 적용한다.
  • 무작위로 샘플링된 포인트의 한정된 집합에서 마스크 손실을 계산하여 학습 메모리를 줄인다.

실험 결과

연구 질문

  • RQ1단일 아키텍처가 파노픽, 인스턴스, 시맨틱 분할에서 최첨단 성능을 달성할 수 있는가?
  • RQ2마스크된 주의력과 고해상도 다중 스케일 특징이 학습 속도를 높이고 정확도를 향상시키는가?
  • RQ3보편적 분할 모델의 실용적 학습을 가능하게 하는 최적화 및 학습 전략은 무엇인가?
  • RQ4일반 데이터셋에서 Mask2Former가 전문화된 아키텍처와 다른 보편 아키텍처와 어떻게 비교되는가?
  • RQ5해당 접근법이 다양한 백본과 데이터셋에서 견고한가?

주요 결과

  • Mask2Former는 여러 데이터셋에서 파노픽, 인스턴스, 시맨틱 분할에 대해 최첨단 또는 동등한 성능을 달성한다.
  • 동일 아키텍처를 사용하여 COCO 파노픽에서 57.8 PQ, COCO 인스턴스에서 50.1 AP, ADE20K 시맨틱 분할에서 57.7 mIoU의 새로운 최첨단 성능을 달성한다.
  • 마스크드 어텐션은 표준 크로스 어텐션에 비해 성능과 수렴을 크게 향상시킨다.
  • 고해상도 다중 스케일 특징은 작은 물체 분할을 크게 향상시키며, 효율적인 다중 스케일 전략이 FLOPs를 감소시킨다.
  • 학습 가능한 쿼리, 드롭아웃 제거, 샘플링 기반 마스크 손실을 통해 학습 효율이 향상되고 메모리를 감소시키면서 정확도를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.