Skip to main content
QUICK REVIEW

[논문 리뷰] DFormer: Diffusion-guided Transformer for Universal Image Segmentation

Hefeng Wang, Jiale Cao|arXiv (Cornell University)|2023. 06. 06.
Medical Image Segmentation Techniques인용 수 7
한 줄 요약

DFormer는 깊이 있는 특징과 마스크된 어텐션을 사용하여 노이즈가 섞인 마스크에서 깨끗한 마스크를 재구성하도록 트레이닝하는 디퓨전 가이드드 트랜스포머를 제안한다. 이는 이미지 세그멘테이션을 노이즈 제거 과정으로 프레임워크화한 것으로, 최신 기술을 초월하는 성능을 달성한다. COCO 파노픽 세그멘테이션에서 3.6% 향상되고, ADE20K 시맨틱 세그멘테이션에서 2.2% 향상된다.

ABSTRACT

This paper introduces an approach, named DFormer, for universal image segmentation. The proposed DFormer views universal image segmentation task as a denoising process using a diffusion model. DFormer first adds various levels of Gaussian noise to ground-truth masks, and then learns a model to predict denoising masks from corrupted masks. Specifically, we take deep pixel-level features along with the noisy masks as inputs to generate mask features and attention masks, employing diffusion-based decoder to perform mask prediction gradually. At inference, our DFormer directly predicts the masks and corresponding categories from a set of randomly-generated masks. Extensive experiments reveal the merits of our proposed contributions on different image segmentation tasks: panoptic segmentation, instance segmentation, and semantic segmentation. Our DFormer outperforms the recent diffusion-based panoptic segmentation method Pix2Seq-D with a gain of 3.6% on MS COCO val2017 set. Further, DFormer achieves promising semantic segmentation performance outperforming the recent diffusion-based method by 2.2% on ADE20K val set. Our source code and models will be publicly on https://github.com/cp3wan/DFormer

연구 동기 및 목표

  • 통합 아키텍처를 통해 다양한 작업(시맨틱, 인스턴스, 파노픽)에 걸쳐 세그멘테이션 모델의 일반화를 해결한다.
  • 비디퓨전 기반 최신 기술 대비 성능이 열등한 기존 디퓨전 기반 세그멘테이션 방법의 한계를 극복한다.
  • 통합 세그멘테이션 프레임워크 내에서 마스크 예측을 위한 생성적 사전 정보로 디퓨전 모델을 사용할 수 있는지를 탐색한다.
  • 현재 세그멘테이션 모델에서 여전히 도전적인 작은 객체와 가림된 인스턴스의 성능을 향상시킨다.

제안 방법

  • 지표 마스크에 다중 수준의 가우시안 노이즈를 추가하여 세그멘테이션 작업을 노이즈 제거 문제로 변환한다.
  • 딥 퍼피얼 레벨 특징과 노이즈가 섞인 마스크를 입력으로 사용하여, 디퓨전 기반 디코더를 통해 마스크 특징과 어텐션 마스크를 생성한다.
  • 학습 중에 노이즈가 섞인 입력에서 단계적으로 깨끗한 마스크를 예측하기 위해 트랜스포머 디코더에서 마스크된 식별 어텐션을 활용한다.
  • 추론 시, 무작위로 노이즈가 섞인 마스크 세트를 생성하고, 동일한 디퓨전 기반 디코더를 사용하여 최종 마스크와 해당 카테고리 예측한다.
  • 노이즈가 섞인 마스크에 이진 임계 처리를 적용하여 어텐션 마스크를 생성함으로써, 예측 중에 관련 영역에 집중할 수 있도록 한다.
  • 스케일 제어(예: 이진 또는 셔플링 인코딩) 기능을 가진 학습 가능한 마스크 인코딩 전략을 사용하여 마스크 표현 학습을 향상시킨다.

실험 결과

연구 질문

  • RQ1디퓨전 기반 생성 과정이 단일 트랜스포머 프레임워크 내에서 여러 이미지 세그멘테이션 작업을 통합하는 데 효과적으로 적용될 수 있는가?
  • RQ2마스크에 가우시안 노이즈를 적용한 노이즈 제거 프레임워크가 직접 마스크 예측과 비교할 때 세그멘테이션 정확도와 일반화 능력에서 어떤가?
  • RQ3다양한 세그멘테이션 작업에서 높은 성능을 달성하기 위해 최적의 디코더 레이어 수와 추론 타임스텝 수는 얼마인가?
  • RQ4다양한 백본 네트워크(예: ResNet-50 대비 Swin-T)와 마스크 인코딩 전략이 파노픽, 인스턴스, 시맨틱 세그멘테이션에서 모델의 성능에 어떤 영향을 미치는가?

주요 결과

  • ResNet-50 백본을 사용할 경우, DFormer는 MS COCO val2017에서 파노픽 퀄리티(PQ) 점수 51.1%를 기록하여 Pix2Seq-𝒟보다 3.6% 높게 기록한다.
  • ADE20K val 세트에서 DFormer는 Swin-T 백본을 사용해 평균 교차점율(mIoU) 48.3%를 달성했으며, 최근의 디퓨전 기반 방법인 DDP를 2.2% 초월한다.
  • 9개의 디코더 레이어를 사용할 경우 인스턴스 세그멘테이션에서 최고 성능(AP = 42.6)을 기록하여, 더 깊은 디코더가 마스크 예측 품질을 향상시킨다는 것을 시사한다.
  • 1단계 전진 프로세스로 추론을 수행할 경우 거의 최적의 성능을 달성하여, 모델이 최소한의 노이즈 제거 단계로도 잘 일반화됨을 시사한다.
  • 스케일 0.1에서 이진 마스크 인코딩 전략이 무작위 셔플링보다 뛰어난 성능을 보이며, 특히 낮은 스케일에서 두드러진다.
  • DFormer는 비디오 인스턴스 세그멘테이션으로도 잘 일반화되어, YouTube-VIS 2019 val 세트에서 AP 46.5를 기록하여 정적 이미지 외부로의 이식 가능성도 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.