Skip to main content
QUICK REVIEW

[논문 리뷰] Reviving Iterative Training with Mask Guidance for Interactive Segmentation

Konstantin Sofiiuk, Ilya A. Petrov|arXiv (Cornell University)|2021. 02. 12.
Advanced Image and Video Retrieval Techniques인용 수 8
한 줄 요약

이 논문은 추론 시 최적화를 필요로 하지 않고도 모든 주요 벤치마크에서 최신 기술 수준 성능을 달성하는 피드포워드, 반복적인 클릭 기반 인터랙티브 세그멘테이션 모델을 제안한다. 이는 이전 단계에서 예측한 마스크를 활용하여 정확도와 안정성을 향상시킨다. 핵심 기여는 COCO+LVIS에서 확보한 고품질, 다양한 애너테이션을 활용한 단순하면서도 효과적인 반복 학습 방식으로, 이는 모델의 일반화 능력을 크게 향상시키며, 새로운 객체 세그멘테이션과 외부 마스크 보정 기능을 모두 가능하게 한다.

ABSTRACT

Recent works on click-based interactive segmentation have demonstrated state-of-the-art results by using various inference-time optimization schemes. These methods are considerably more computationally expensive compared to feedforward approaches, as they require performing backward passes through a network during inference and are hard to deploy on mobile frameworks that usually support only forward passes. In this paper, we extensively evaluate various design choices for interactive segmentation and discover that new state-of-the-art results can be obtained without any additional optimization schemes. Thus, we propose a simple feedforward model for click-based interactive segmentation that employs the segmentation masks from previous steps. It allows not only to segment an entirely new object, but also to start with an external mask and correct it. When analyzing the performance of models trained on different datasets, we observe that the choice of a training dataset greatly impacts the quality of interactive segmentation. We find that the models trained on a combination of COCO and LVIS with diverse and high-quality annotations show performance superior to all existing models. The code and trained models are available at https://github.com/saic-vul/ritm_interactive_segmentation.

연구 동기 및 목표

  • 복잡한 추론 시 최적화 기법 없이 최신 기술 수준의 인터랙티브 세그멘테이션 성능를 달성할 수 있는지 조사하기.
  • 학습 데이터셋의 품질과 다양성이 인터랙티브 세그멘테이션 성능에 미치는 영향 평가하기.
  • 이전 마스크 출력을 반복적으로 활용하여 예측을 개선하는 피드포워드 모델 개발하기. 이는 새로운 객체 세그멘테이션과 외부 마스크 보정 모두 가능하게 한다.
  • 고품질, 다양한 데이터셋에서 훈련된 강력한 베이스라인 모델이 더 복잡한 개선 메커니즘을 가진 모델보다 뛰어난 성능을 낼 수 있음을 입증하기.

제안 방법

  • 이전 클릭에서 생성된 세그멘테이션 마스크를 네트워크 입력으로 포함하는 피드포워드 모델을 제안하여, 역전파 없이도 반복적인 개선이 가능하도록 한다.
  • 모델이 각 단계에서 이전 반복의 진짜 마스크를 사용하여 향상된 마스크를 예측하도록 하는 반복 학습 절차를 도입한다.
  • 다양하고 고품질의 인스턴스 애너테이션을 활용하기 위해 COCO+LVIS 데이터셋을 결합하여 학습함으로써, 다양한 객체 카테고리 간 일반화 능력을 향상시킨다.
  • 특징 표현을 향상시키기 위해 HRNet 기반 백본(H18, H18s, H32)과 OCR(Object Context Representation) 모듈을 사용한다.
  • 복잡한 데이터 증강이나 히우리스틱 클릭 시뮬레이션을 피하기 위해, 훈련 중 클릭 시뮬레이션에 표준적인 랜덤 포인트 샘플링을 적용한다.
  • 각 클릭이 단일 포워드 패스를 통해 마스크 예측을 업데이트하는 다단계 추론 프로세스를 적용하여 효율성을 유지한다.

실험 결과

연구 질문

  • RQ1복잡한 추론 시 최적화에 의존하지 않는 단순한 피드포워드 모델이, 마스크 가이던스를 통한 반복 학습을 통해 최신 기술 수준의 방법을 능가할 수 있는가?
  • RQ2학습 데이터셋 선택, 특히 그 다양성과 애너테이션 품질이 인터랙티브 세그멘테이션 성능에 미치는 영향은 어떠한가?
  • RQ3COCO+LVIS에서 훈련된 모델이 뛰어난 일반화 능력을 확보하고, 새로운 객체 세그멘테이션과 마스크 보정 모두에 대응할 수 있는가?
  • RQ4마스크 피드백을 통한 반복 학습이 모델의 안정성을 향상시키고, 추가 클릭 후 정확도 저하를 방지하는가?

주요 결과

  • HRNet-18s+OCR 백본을 사용한 제안된 반복 피드포워드 모델(IT-M)은 Pascal VOC에서 NoC@90가 4.70을 기록하여 이전 모든 방법을 능가한다.
  • Berkeley 데이터셋에서 H18s IT-M 버전은 NoC@90가 1.68를 기록하여 이전 최신 기술 수준의 3.07을 크게 상회한다.
  • COCO+LVIS에서 훈련된 모델은 GrabCut에서 NoC@85가 1.54를 기록하여 이전 최신 기술 수준의 2.60을 초월한다.
  • 반복 모델은 어떤 클릭 이후에도 정확도 저하 없이 안정적인 성능을 보이며, 모든 벤치마크에서 일관되게 높은 IoU 값으로 수렴한다.
  • 가장 작은 모델(H18s IT-M)이 더 큰 버전과 유사한 성능을 보이며, 모바일 및 저성능 컴퓨팅 장치에의 배포를 가능하게 한다.
  • 제거 분석 결과, COCO+LVIS와 같이 다양하고 고품질의 데이터셋에서의 학습이 필수적임을 확인하였으며, 더粗악하거나 작은 데이터셋에서의 학습은 성능이 크게 열등하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.