Skip to main content
QUICK REVIEW

[논문 리뷰] CNOS: A Strong Baseline for CAD-based Novel Object Segmentation

Van Nguyen Nguyen, Thibault Groueix|arXiv (Cornell University)|2023. 07. 20.
Advanced Neural Network Applications인용 수 4
한 줄 요약

CNOS는 단지 CAD 모델만을 사용하여 새로운 물체 분할을 위한 단순하면서도 강력한 제로샷 방법을 제안한다. 이는 제안을 위해 Segment Anything를 활용하고, 사전 渲染된 템플릿과의 매칭을 위해 DINOv2의 [cls] 토큰을 사용한다. BOP 벤치마크에서 최신 기술을 초월하여 이전의 비지도 학습 방법보다 19.8% AP 높은 성능을 기록했으며, 마스크 R-CNN과 같은 지도 학습 방법조차도 능가한다.

ABSTRACT

We propose a simple three-stage approach to segment unseen objects in RGB images using their CAD models. Leveraging recent powerful foundation models, DINOv2 and Segment Anything, we create descriptors and generate proposals, including binary masks for a given input RGB image. By matching proposals with reference descriptors created from CAD models, we achieve precise object ID assignment along with modal masks. We experimentally demonstrate that our method achieves state-of-the-art results in CAD-based novel object segmentation, surpassing existing approaches on the seven core datasets of the BOP challenge by 19.8% AP using the same BOP evaluation protocol. Our source code is available at https://github.com/nv-nguyen/cnos.

연구 동기 및 목표

  • 로봇 및 AR 응용 분야에서 각각 새로운 물체를 위해 재학습이 필요한 지도 학습 방법의 한계를 해결하기 위해.
  • 비용이 많이 들고 시간이 오래 걸리는 데이터 수집과 재학습을 피하기 위해, 단지 CAD 모델만을 사용하여 제로샷 분할을 가능하게 하기 위해.
  • 기존의 비지도 학습 및 지도 학습 방법보다 뛰어난 성능을 보이는, 단순하면서도 강력한 기초 기반 모델을 개발하기 위해.
  • DINOv2와 사진 수준의 렌더링을 활용하여 실제 이미지와 합성 이미지 간의 도메인 갭을 줄이기 위해.

제안 방법

  • CNOS는 FastSAM 또는 SAM을 사용하여 입력 RGB 이미지에서 분할 제안을 생성한다.
  • 이를 위해 다수의 시점에서 CAD 모델을 사전에 렌더링하여 템플릿을 생성하고, 각 템플릿을 DINOv2 [cls] 토큰으로 인코딩하여 시각적 기술을 제공한다.
  • 추론 시, 제안된 영역과 템플릿 간의 유사도를 DINOv2 [cls] 토큰 간의 코사인 유사도로 계산하여 매칭한다.
  • 마스크 신뢰도의 최종 점수로는 유사도 점수 상위 k개(5개)의 평균(Meanₖ, k=5)를 사용한다.
  • 도메인 갭을 줄이고 정확도를 향상시키기 위해 BlenderProc를 활용한 사진 수준의 렌더링을 사용한다.
  • 온보딩은 한 번만 수행되는 과정이며, 템플릿 렌더링과 각 CAD 모델에 대한 DINOv2 기술자 추출이 포함된다.

실험 결과

연구 질문

  • RQ1CAD 모델만을 기반으로 하는 제로샷 방법이 신규 물체 분할 분야에서 최신 기술 성능을 달성할 수 있는가?
  • RQ2DINOv2 [cls] 토큰 간의 유사도가 실제 이미지 제안과 합성 CAD 템플릿 간의 매칭에 얼마나 효과적인가?
  • RQ3표준 렌더링 대비 사진 수준의 렌더링이 제로샷 분할 정확도를 뚜렷이 향상시키는가?
  • RQ4CNOS는 어떤 미세조정 없이도 지도 학습 및 비지도 학습 기반 모델을 모두 능가할 수 있는가?

주요 결과

  • CNOS는 FastSAM과 ViT-l를 사용하여 LM-O 데이터셋에서 39.7% AP를 기록했으며, 이는 이전의 SOTA 비지도 학습 방법보다 19.8% AP 높은 성능이다.
  • 수천 개의 이미지가 각각 훈련된 지도 학습 방법인 Mask R-CNN을 능가함으로써, 강력한 제로샷 일반화 능력을 입증했다.
  • BlenderProc를 사용한 사진 수준의 렌더링은 표준 Pyrender 렌더링 대비 정확도를 0.2% AP 향상시켰다.
  • Meanₖ (k=5) 집계 함수가 가장 뛰어난 성능을 보였으며, Max 대비 3.2% 향상되고 Mean 대비도 3.2% 향상되었다.
  • 표준 렌더링을 사용할 경우, CAD 모델당 온보딩 시간이 2초 이내로, 산업적 구현에 실용적이다.
  • 시점 변화에 대해 매우 강건하며, 밀도 높은 시점 렌더링(162개 시점)이 희소한 시점 렌더링(42개 시점)과 거의 동일한 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.