Skip to main content
QUICK REVIEW

[논문 리뷰] Source-free Depth for Object Pop-out

Zongwei Wu, Danda Pani Paudel|arXiv (Cornell University)|2022. 12. 10.
Image Enhancement Techniques인용 수 5
한 줄 요약

이 논문은 원천 데이터 없이 깊이 지식을 세분화에 전이하기 위해 3D '팝아웃' 사전 지식을 사용하는 소스 프리 도메인 적응 방법을 제안한다. 이 방법은 물체가 배경 표면 위에 놓여져 있다고 가정하며, 원천 데이터 없이 깊이 맵에서 물체와 배경 사이의 접촉 표면을 학습함으로써 정확한 물체 정위치 및 의미적 감독을 가능하게 한다. 이로 인해 여덟 개의 데이터셋에서 유의미하고 은폐된 물체 검출 작업에서 최신 기술 수준의 성능을 달성하며, 일반화 능력과 효율성이 향상된다.

ABSTRACT

Depth cues are known to be useful for visual perception. However, direct measurement of depth is often impracticable. Fortunately, though, modern learning-based methods offer promising depth maps by inference in the wild. In this work, we adapt such depth inference models for object segmentation using the objects' "pop-out" prior in 3D. The "pop-out" is a simple composition prior that assumes objects reside on the background surface. Such compositional prior allows us to reason about objects in the 3D space. More specifically, we adapt the inferred depth maps such that objects can be localized using only 3D information. Such separation, however, requires knowledge about contact surface which we learn using the weak supervision of the segmentation mask. Our intermediate representation of contact surface, and thereby reasoning about objects purely in 3D, allows us to better transfer the depth knowledge into semantics. The proposed adaptation method uses only the depth model without needing the source data used for training, making the learning process efficient and practical. Our experiments on eight datasets of two challenging tasks, namely camouflaged object detection and salient object detection, consistently demonstrate the benefit of our method in terms of both performance and generalizability.

연구 동기 및 목표

  • 원천 학습 데이터에 접근할 수 없을 때도 깊이 지식을 의미 분석으로 교차 도메인, 교차 작업 전이를 가능하게 하기 위해.
  • 원천 도메인이 다를 때이고 레이블이 연속적일 경우, 깊이 모델에서 의미 세분화로 지식을 전이하는 데 도전하는 데에.
  • 오직 소스 프리 깊이 예측만을 사용하여 유의미하고 은폐된 물체 검출의 일반화 능력과 성능을 향상시키기 위해.
  • 물체의 3D 구성 사전 지식인 '팝아웃'을 활용하여 향상된 3D 추론과 의미적 감독을 가능하게 하기 위해.
  • 원천 데이터 없이 사전에 훈련된 깊이 모델만을 사용하여 데이터 프라이버시 문제와 전이 비효율성을 피하는 효과적인 도메인 적응을 달성하기 위해.

제안 방법

  • 이 방법은 원천 데이터 없이 깊이 맵에서 물체 팝아웃과 접촉 표면 예측을 동시에 학습하는 새로운 네트워크 아키텍처를 도입한다.
  • 물체가 배경 표면 위에 서 있다고 모델링함으로써 '팝아웃' 사전 지식을 강제 적용하여 3D 인식 가능한 물체-배경 분리가 가능해진다.
  • 세그멘테이션 마스크로부터 약한 감독을 통해 접촉 표면을 학습함으로써 모델이 3D 공간에서 물체 경계를 추론할 수 있도록 한다.
  • 깊이 및 접촉 표면 예측에서 파생된 가짜 세그멘테이션 마스크를 사용하여 물체 팝아웃 및 접촉 표면 네트워크를 엔드 투 엔드로 훈련한다.
  • 적응 과정에서 원천 데이터가 필요 없이 추론 시에 오직 사전에 훈련된 깊이 모델만을 사용한다.
  • 중간 단계로 3D 인식 표현을 생성함으로써 깊이에서 의미로의 효과적인 지식 전이를 가능하게 한다.
Figure 1 : Depth to semantics conversion using the object pop-out prior. For input RGB and source-free depth pair, we learn contact surface. The obtained contact surface is then used to separate objects and backgrounds to derive pseudo semantics for supervision.
Figure 1 : Depth to semantics conversion using the object pop-out prior. For input RGB and source-free depth pair, we learn contact surface. The obtained contact surface is then used to separate objects and backgrounds to derive pseudo semantics for supervision.

실험 결과

연구 질문

  • RQ1원천 학습 데이터에 접근할 수 없을 때 깊이 지식을 의미 세분화로 효과적으로 전이할 수 있는가?
  • RQ2소스 프리 환경에서 3D '팝아웃' 사전 지식을 어떻게 활용하여 물체 정위치 및 의미적 감독을 향상시킬 수 있는가?
  • RQ3물체와 배경 사이의 접촉 표면을 학습하면 자원이 제한된 환경 및 도메인 이동 상황에서 깊이-의미 전이 성능을 향상시킬 수 있는가?
  • RQ4이러한 방법은 유의미하고 은폐된 물체 검출과 같은 다양한 데이터셋과 작업에 대해 일반화되는가?
  • RQ5오직 소스 프리 깊이 맵만을 사용할 때, 기존의 RGB 전용 및 RGB-D 기반 모델보다 성능이 뛰어나게 되는가?

주요 결과

  • 제안된 방법은 두 가지 도전적인 작업인 유의미한 물체 검출(SOD)과 은폐된 물체 검출(COD)에서 여덟 개의 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.
  • NC4K 데이터셋에서, 전체 데이터의 25%만으로 훈련해도 F-측정치는 +0.4% 향상되고 S-측정치는 +0.1% 향상되어, 전체 데이터로 훈련된 기존 베이스라인을 초월한다.
  • NC4K에서 M-측정치 0.042, F-측정치 0.861을 기록하여, RGB 전용 모델 중 최고 성능을 보인 ZoomNet과 모든 기존 RGB-D 모델을 뛰어넘었다.
  • HAINet에서 F-측정치 오차를 0.011 감소시키고 SPNet에서는 0.010 감소시켜 강력한 일반화 능력과 강인성을 입증했다.
  • 다중 물체 시나리오에서도 높은 성능 유지하여 NC4K에서 단일 물체일 경우 F-측정치 0.864, 두 개 물체일 경우 0.847, 두 개 이상일 경우 0.767을 기록했다.
  • 실험 결과 기존의 RGB-D 방법들은 소스 프리 깊이에서 유의미한 이점을 얻지 못하는 반면, 제안된 방법은 이를 능가하여 실제 도메인 이동 환경에서의 효과성을 입증했다.
Figure 2 : The performance gained in F-measure using our method over the established baselines. Our method ( $\blacktriangle$ , $\blacksquare$ ) significantly improves baselines on 8 datasets and 2 tasks (each task on 4 datasets– SOD: left two; COD: right two). We also compare 24 methods ( $\bullet$
Figure 2 : The performance gained in F-measure using our method over the established baselines. Our method ( $\blacktriangle$ , $\blacksquare$ ) significantly improves baselines on 8 datasets and 2 tasks (each task on 4 datasets– SOD: left two; COD: right two). We also compare 24 methods ( $\bullet$

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.