Skip to main content
QUICK REVIEW

[논문 리뷰] MOVE: Unsupervised Movable Object Segmentation and Detection

Adam Bielski, Paolo Favaro|arXiv (Cornell University)|2022. 10. 14.
Visual Attention and Saliency Detection인용 수 6
한 줄 요약

MOVE는 물리적으로 타당한 局소적 객체 이동을 감독 신호로 활용하여 비지도 이동 가능한 객체 분할 및 검출을 위한 자기지도 학습 방법을 제안한다. 사전 훈련된 SSL 특징(예: DINO, MAE), 인painting 네트워크, 그리고 적대적 훈련을 사용하여 이동된 전경의 분할 아티팩트를 탐지하며, 단일 객체 탐지에서 평균 CorLoc 7.2% 향상과 클래스 무관 검출에서 상대적 AP 53% 향상으로 최신 기술 수준(SotA) 성능을 달성한다.

ABSTRACT

We introduce MOVE, a novel method to segment objects without any form of supervision. MOVE exploits the fact that foreground objects can be shifted locally relative to their initial position and result in realistic (undistorted) new images. This property allows us to train a segmentation model on a dataset of images without annotation and to achieve state of the art (SotA) performance on several evaluation datasets for unsupervised salient object detection and segmentation. In unsupervised single object discovery, MOVE gives an average CorLoc improvement of 7.2% over the SotA, and in unsupervised class-agnostic object detection it gives a relative AP improvement of 53% on average. Our approach is built on top of self-supervised features (e.g. from DINO or MAE), an inpainting network (based on the Masked AutoEncoder) and adversarial training.

연구 동기 및 목표

  • 인간 애너테이션 마스크 또는 바운딩 박스가 필요 없이 비지도 객체 분할 및 검출을 위한 자기지도 학습 방법을 개발하는 것.
  • 이동 가능한 전경 객체가 국소적으로 이동 가능함으로써 현실적인 새로운 이미지를 생성할 수 있는 물리적 성질을 활용하여 이를 감독 신호로 사용하는 것.
  • 기존 최신 기술 수준(SotA) 방법을 초월하여 비지도 주목할 만한 객체 탐지 및 클래스 무관 객체 탐지 성능을 향상시키는 것.
  • 생성 모델 또는 복잡한 시나리오 합성에 의존하지 않고, 인painting과 이동 기반 아티팩트 탐지로 훈련하는 것.

제안 방법

  • 사전 훈련된 비전 트랜스포머(예: DINO 또는 MAE 인코더)를 동결된 백본으로 사용하여 자기지도 특징을 추출한다.
  • U-Net 유사한 업샘플링 CNN 기반의 분할 헤드가 이러한 특징에서 전경 마스크를 예측한다.
  • MAE에 적대적 손실을 적용한 인painting 네트워크가 마스킹된 이미지에서 배경을 재구성한다.
  • 예측된 전경 객체를 국소적으로 이동시켜 인paint된 배경에 붙여넣음으로써 복합 이미지를 생성한다.
  • 복합 이미지에서 발생하는 아티팩트(예: 텍스처 불일치 또는 중복 영역)를 감독 신호로 사용한다: 올바른 마스크는 이러한 아티팩트를 최소화한다.
  • 구성된 이미지에 대한 적대적 훈련을 통해 세그먼터를 훈련한다: 판별기는 진짜 이미지와 가짜 복합 이미지(이동된 전경) 및 가짜 복사-붙여넣기 이미지(원본에 이동된 객체)를 구분한다.

실험 결과

연구 질문

  • RQ1객체 이동 가능성이라는 물리적 성질이 비지도 객체 분할에 강력하고 신뢰할 수 있는 감독 신호로 기능할 수 있는가?
  • RQ2이동 유도 아티팩트 기반 방법이 SSL 특징 기반 클러스터링 접근법보다 비지도 분할 과제에서 더 우수한 성능을 낼 수 있는가?
  • RQ3생성 모델 훈련 또는 합성 데이터 생성 없이도 일반화 능력과 성능 향상에 유리한가?
  • RQ4이동 가능성 기반 감독은 주목할 만한 객체 탐지 및 클래스 무관 객체 탐지 벤치마크에서 얼마나 향상된 성능을 낼 수 있는가?

주요 결과

  • VOC07, VOC12, COCO20K에서 MOVE는 비지도 단일 객체 탐지에서 최신 기술 수준(SotA) 대비 평균 CorLoc 7.2% 향상 달성.
  • COCOval2017에서 비지도 클래스 무관 객체 탐지 시 MOVE는 AP50를 6.8% 향상(상대적 56%), AP75를 2.3% 향상(상대적 55%), AP를 2.7% 향상(상대적 49%) 달성.
  • DUTS-TR와 같이 다양한 데이터셋에 걸쳐 강력한 일반화 성능 보이며, 감독 기반 기준선과 유사한 성능 기록.
  • 제거 분석 결과, 재구성 오차나 클러스터링 기반 방법보다 이동 가능성은 더 견고한 감독 신호임을 확인.
  • 복합 이미지에 대한 적대적 훈련을 통해 현실감 있는 이미지를 생성하고, 특히 경계 영역에서 마스크 품질 향상.
  • 연결 요소를 통한 후처리로 다중 객체 복구 가능하나, 이동 가능성 모호성으로 인해 일부 객체는 여전히 누락될 수 있음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.