Skip to main content
QUICK REVIEW

[논문 리뷰] SegRefiner: Towards Model-Agnostic Segmentation Refinement with Discrete Diffusion Process

Mengyu Wang, Henghui Ding|arXiv (Cornell University)|2023. 12. 19.
Advanced Neural Network Applications인용 수 6
한 줄 요약

SegRefiner는 재학습이 필요하지 않은 모델에 관계없이 마스크 개선을 위한 프레임워크를 제안하며, 마스크 개선을 이산 확산 과정으로 간주하여 단방향 픽셀 상태 전이를 통해 근본적인 마스크를 반복적으로 노이즈 제거한다. 이는 의미적, 인스턴스, 이분할 이미지 세분화에서 최고 성능을 달성하며, 이전의 모델에 관계없는 방법보다 IoU는 +3.42, Mask AP는 +0.9 향상되었고, 고해상도 이미지에서 미세한 세부 정보를 잘 유지하는 데 강력한 능력을 보였다.

ABSTRACT

In this paper, we explore a principal way to enhance the quality of object masks produced by different segmentation models. We propose a model-agnostic solution called SegRefiner, which offers a novel perspective on this problem by interpreting segmentation refinement as a data generation process. As a result, the refinement process can be smoothly implemented through a series of denoising diffusion steps. Specifically, SegRefiner takes coarse masks as inputs and refines them using a discrete diffusion process. By predicting the label and corresponding states-transition probabilities for each pixel, SegRefiner progressively refines the noisy masks in a conditional denoising manner. To assess the effectiveness of SegRefiner, we conduct comprehensive experiments on various segmentation tasks, including semantic segmentation, instance segmentation, and dichotomous image segmentation. The results demonstrate the superiority of our SegRefiner from multiple aspects. Firstly, it consistently improves both the segmentation metrics and boundary metrics across different types of coarse masks. Secondly, it outperforms previous model-agnostic refinement methods by a significant margin. Lastly, it exhibits a strong capability to capture extremely fine details when refining high-resolution images. The source code and trained models are available at https://github.com/MengyuWang826/SegRefiner.

연구 동기 및 목표

  • 다양한 모델에서 유도된 굵은 마스크를 재학습 없이 개선하는 과제를 해결하기 위해.
  • 다양한 세분화 작업에서 경계 정확도와 미세한 세부 정보 캡처 능력을 향상시키기 위해.
  • 다양한 세분화 아키텍처와 작업에 적용 가능한 일반화 능력이 뛰어난 모델에 관계없는 개선 프레임워크를 개발하기 위해.
  • 단일 단계 개선의 한계를 극복하기 위해 새로운 이산 확산 과정을 통해 반복적인 노이즈 제거를 활용하기 위해.
  • 성능 저하가 최소화되고 다양한 데이터셋과 작업 간에 강력한 일반화 능력을 보이는 고해상도 마스크 개선을 가능하게 하기 위해.

제안 방법

  • SegRefiner는 입력 이미지가 반복적인 마스크 개선을 이끄는 조건부 데이터 생성 작업으로 세분화 개선을 공식화한다.
  • 훈련 중에 각 픽셀이 지표 마스크에서 굵은 마스크로 향하는 단방향, 무작위 상태 전이를 거치는 새로운 이산 확산 과정을 도입한다.
  • 추론 시에는 굵은 마스크가 노이즈가 있는 시작점이 되며, 모델은 각 픽셀의 레이블 전이와 확률을 예측함으로써 반복적인 노이즈 제거를 수행한다.
  • 모델은 이미지 컨텍스트와 현재 마스크 상태를 기반으로 각 픽셀의 다음 상태를 예측하기 위해 조건부 노이즈 제거 헤드를 갖춘 U-Net 기반 아키텍처를 사용한다.
  • 전역 및 국소 개선 전략을 모두 지원하며, 이 조합이 고해상도 이미지에서 최적의 성능을 달성한다.
  • 모델에 관계없는 설계를 통해 어떤 세분화 모델의 출력과도 아키텍처 수정 없이 원활하게 통합될 수 있도록 설계되었다.

실험 결과

연구 질문

  • RQ1다양한 세분화 작업에서 모델에 관계없는 방식으로 이산 확산 과정이 마스크 개선에 효과적으로 기여할 수 있는가?
  • RQ2경계 정확도나 미세한 세부 정보 누락과 같은 복잡한 오류를 수정할 때, 단일 단계 개선에 비해 반복적이고 단계적인 노이즈 제거 방식은 어떤가?
  • RQ3전역 및 국소 개선의 조합이 고해상도 이미지 세분화에 어떤 영향을 미치는가?
  • RQ4입력 해상도의 선택이 정확도, 추론 속도, 계산 비용 간의 트레이드오프에 어떤 영향을 미치는가?
  • RQ5이전 방법에 비해 이산 확산 과정이 고해상도 이미지에서 미세한 세부 정보를 얼마나 잘 유지할 수 있는가?

주요 결과

  • SegRefiner는 기존의 최고 수준의 모델에 관계없는 방법보다 의미적 세분화에서 평균 IoU를 +3.42, mBA를 +2.21 향상시켰다.
  • 인스턴스 세분화에서는 이전 최고 수준의 방법보다 +0.9 Mask AP와 +2.2 Boundary AP를 달성했다.
  • 이 방법은 아키텍처 변경 없이도 최근 제안된 이분할 이미지 세분화 작업에서 최고 성능을 기록하며 강력한 일반화 능력을 입증했다.
  • 절단 실험을 통해 이산 확산 과정이 성능 향상에 크게 기여하며, 비확산 기반 베이스라인 대비 2.54점의 mBA 향상을 확인했다.
  • 전역 및 국소 개선의 조합이 최적의 균형을 이뤘으며, BIG 데이터셋에서 94.85 IoU와 77.64 mBA를 기록하여 단일 전략 방식을 초월했다.
  • 추론 시간과 계산 비용은 확산 단계 수에 따라 선형적으로 증가하며, 인스턴스 세분화에서 6단계는 2.94초, 1492 GFLOPs의 계산량을 소모한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.