Skip to main content
QUICK REVIEW

[논문 리뷰] MP-Former: Mask-Piloted Transformer for Image Segmentation

Hao Zhang, Feng Li|arXiv (Cornell University)|2023. 03. 13.
Advanced Neural Network Applications인용 수 6
한 줄 요약

MP-Former는 모든 디코더 레이어에서 노이즈가 섞인 진짜 마스크를 어텐션 마스크로 공급하는 마스크-도구형 훈련 방식을 도입하여 Mask2Former의 성능을 향상시킨다. 이는 정확한 예측을 재구성할 수 있도록 해주며, 레이어 간 일관성 없는 마스크 예측을 줄이고, 쿼리 활용도를 높이며, ResNet-50 기반으로 Cityscapes에서 +2.3 AP와 +1.6 mIoU를 달성하면서 훈련 시간을 절반으로 줄이고 추론 시 계산 부담을 거의 증가시키지 않는다.

ABSTRACT

We present a mask-piloted Transformer which improves masked-attention in Mask2Former for image segmentation. The improvement is based on our observation that Mask2Former suffers from inconsistent mask predictions between consecutive decoder layers, which leads to inconsistent optimization goals and low utilization of decoder queries. To address this problem, we propose a mask-piloted training approach, which additionally feeds noised ground-truth masks in masked-attention and trains the model to reconstruct the original ones. Compared with the predicted masks used in mask-attention, the ground-truth masks serve as a pilot and effectively alleviate the negative impact of inaccurate mask predictions in Mask2Former. Based on this technique, our \M achieves a remarkable performance improvement on all three image segmentation tasks (instance, panoptic, and semantic), yielding $+2.3$AP and $+1.6$mIoU on the Cityscapes instance and semantic segmentation tasks with a ResNet-50 backbone. Our method also significantly speeds up the training, outperforming Mask2Former with half of the number of training epochs on ADE20K with both a ResNet-50 and a Swin-L backbones. Moreover, our method only introduces little computation during training and no extra computation during inference. Our code will be released at \url{https://github.com/IDEA-Research/MP-Former}.

연구 동기 및 목표

  • Mask2Former의 연속된 디코더 레이어 간 일관성 없는 마스크 예측 문제를 해결하여 최적화를 저해하고 쿼리 활용도를 감소시키는 문제를 해결한다.
  • 훈련 중에 진짜 마스크를 도구 신호로 사용하여 트랜스포머의 마스크 기반 어텐션을 이미지 세그멘테이션에 향상시킨다.
  • 추론 비용이나 모델 복잡도를 증가시키지 않으면서 성능을 향상시키는 훈련 방법을 개발한다.
  • 여러 벤치마크에서 세그멘테이션 정확도를 유지하거나 향상시키면서 훈련 수렴 속도를 가속화한다.

제안 방법

  • 디코더 쿼리를 표준 이항 매칭 방식을 사용하는 매칭 부분과 진짜 클래스 임베딩과 마스크를 쿼리 및 어텐션 마스크로 사용하는 마스크-도구형(MP) 부분으로 나눈다.
  • 노이즈가 섞인 입력에서 원래의 진짜 마스크와 레이블을 재구성하도록 MP 부분을 훈련하며, 점 노이즈와 레이블 뒤집기 기법을 사용해 강건성을 향상시킨다.
  • 모든 디코더 레이어에 걸쳐 다중 레이어 마스크-도구형 훈련을 적용하여 예측을 안정화하고 일관성을 향상시킨다.
  • 코arse-to-fine 특징 맵을 디코더에서 사용하며, 가장 큰 특징 맵(1/8 해상도)을 모든 레이어에서 공통으로 사용하여 특징 정교화를 향상시킨다.
  • 클래스 임베딩을 MP 부분의 쿼리로 사용하여 레이블 가이드 훈련을 도입함으로써 마스크 및 클래스 예측 복구를 동시에 가능하게 한다.
  • 진짜 마스크와 레이블에 점 노이즈, 스케일링, 이동 노이즈를 적용하여 일반화 및 강건성을 강화한다.

실험 결과

연구 질문

  • RQ1디코더 레이어 간 일관성 없는 마스크 예측이 Mask2Former의 성능을 떨어뜨리며, 이는 정량적으로 측정할 수 있는가?
  • RQ2마스크 기반 어텐션에서 진짜 마스크를 도구 신호로 사용하면 예측 일관성과 성능이 향상되는가?
  • RQ3노이즈 증강을 적용한 다중 레이어 마스크-도구형 훈련이 더 나은 쿼리 활용도와 세그멘테이션 정확도를 가져오는가?
  • RQ4제안된 방법이 훈련 단계를 줄이면서도 Mask2Former의 성능을 유지하거나 초월할 수 있는가?
  • RQ5이 방법이 유의미한 추론 오버헤드나 아키텍처 변경을 유도하는가?

주요 결과

  • ResNet-50 백본을 사용할 때 MP-Former은 Cityscapes에서 인스턴스 및 의미적 세그멘테이션 작업에서 +2.3 AP와 +1.6 mIoU를 달성한다.
  • ADE20K에서는 36 에포크로 훈련된 MP-Former이 50 에포크로 훈련된 Mask2Former와 동일한 성능을 내며, 80k 스텝에서는 160k 스텝에서 훈련된 Mask2Former와 동일한 성능을 달성한다.
  • Swin-L 백본을 사용할 경우, 72 에포크 후 COCO 인스턴스 세그멘테이션에서 +1.1 AP를 기록하며 Mask2Former를 초월한다.
  • 이 방법은 층 간 쿼리 활용도와 평균 IoU를 크게 향상시켜, 예측 일관성 저감 효과가 효과적임을 입증한다.
  • 점 노이즈를 추가하면 +0.3 AP 향상이 발생하지만, 스케일링 및 이동 노이즈는 유의미한 이점을 제공하지 않는다.
  • 모든 레이어에서 가장 큰 특징 맵(1/8)을 사용하는 것이 Mask2Former의 설계와는 반대로 MP-Former에서 더 높은 성능을 내며, 이는 코arse-to-fine 특징 맵보다 우수함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.