[논문 리뷰] Skin Segmentation from NIR Images using Unsupervised Domain Adaptation through Generative Latent Search.
이 논문은 근적외선(NIR) 영상에서 피부 분할을 위한 비지도 도메인 적응 방법을 제안한다. 이 방법은 라벨이 없는 NIR 데이터가 필요 없이, 가시광선 레드채널 영상(소스 도메인)을 사용해 모델을 훈련시킨다. 변동형 오토에인코더(VAE)의 잠재공간에서 타겟 NIR 영상의 '가장 유사한 복제본'(nearest-clone)을 탐색함으로써 효과적인 도메인 적응이 가능하며, 새로 제작된 두 개의 NIR 피부 분할 데이터셋에서 최신 기술(SOTA) 수준의 성능을 달성한다.
Segmentation of the pixels corresponding to human skin is an essential first step in multiple applications ranging from surveillance to heart-rate estimation from remote-photoplethysmography. However, the existing literature considers the problem only in the visible-range of the EM-spectrum which limits their utility in low or no light settings where the criticality of the application is higher. To alleviate this problem, we consider the problem of skin segmentation from the Near-infrared images. However, Deep learning based state-of-the-art segmentation techniques demands large amounts of labelled data that is unavailable for the current problem. Therefore we cast the skin segmentation problem as that of target-independent unsupervised domain adaptation (UDA) where we use the data from the Red-channel of the visible-range to develop skin segmentation algorithm on NIR images. We propose a method for target-independent segmentation where the 'nearest-clone' of a target image in the source domain is searched and used as a proxy in the segmentation network trained only on the source domain. We prove the existence of 'nearest-clone' and propose a method to find it through an optimization algorithm over the latent space of a Deep generative model based on variational inference. We demonstrate the efficacy of the proposed method for NIR skin segmentation over the state-of-the-art UDA segmenation methods on the two newly created skin segmentation datasets in NIR domain despite not having access to the target NIR data.
연구 동기 및 목표
- 저조도 조건에서 가장 중요한 응용 분야이지만, 라벨이 부족한 근적외선(NIR) 영상에서 피부 분할에 대한 라벨이 부족한 문제를 해결한다.
- NIR 피부 분할에 대해 사용 가능한 레이블이 없기 때문에, 대량의 애너테이션 데이터에 의존하는 기존 딥러닝 방법의 한계를 극복한다.
- 가시광선 스펙트럼(레드채널)에서의 지식을 NIR 도메인으로 전이할 수 있는, 타겟 독립적인 비지도 도메인 적응(UDA) 프레임워크를 개발한다.
- 타겟(NIR) 도메인에 대한 어떤 애너테이션도 요구하지 않고도, NIR 영상에서 강력한 피부 분할을 가능하게 한다.
- 새로 제작된 공개 가능한 두 개의 NIR 피부 분할 데이터셋에서 제안된 방법의 유효성을 입증한다.
제안 방법
- 가시광선(레드채널)에서의 라벨이 있는 데이터를 활용해, 타겟 도메인(NIR)의 레이블이 없는 영상에 대해 적용 가능한 타겟 독립적인 비지도 도메인 적응(UDA) 문제로 피부 분할을 재정의한다.
- 변동형 오토에인코더(VAE)의 잠재공간에서, 타겟 NIR 영상와 가장 유사한 소스 도메인의 합성 영상인 '가장 유사한 복제본'(nearest-clone) 개념을 도입한다.
- 재구성 오차와 분포의 산란을 최소화함으로써, VAE의 잠재공간에서 타겟 영상의 가장 유사한 복제본을 찾기 위해 최적화를 수행한다.
- 가장 유사한 복제본을 분할 네트워크의 대체 입력으로 사용하며, 이 네트워크는 오직 소스 도메인(가시광선 레드채널)에서만 훈련되기 때문에, 타겟(NIR) 도메인으로의 적응이 가능해진다.
- 약한 가정 하에 잠재공간 내에서 가장 유사한 복제본의 존재를 증명함으로써, 최적화 접근법의 타당성을 보장한다.
- 소스 도메인(가시광선 레드채널)의 애너테이션만을 사용해 분할 네트워크를 훈련시키며, 가장 유사한 복제본을 통한 대체 입력을 통해 타겟 도메인(NIR) 영상의 예측을 유도한다.
실험 결과
연구 질문
- RQ1가시광선 레드채널 영상에서 훈련된 소스 도메인 모델이, 타겟 도메인(NIR) 영상에 대한 라벨이 전혀 없이도 효과적으로 일반화될 수 있는가?
- RQ2잠재공간 최적화를 통해 소스 도메인 내에서 타겟 NIR 영상와 유사한 의미 있는 대체 영상(프록시)을 찾을 수 있는가?
- RQ3변동형 오토에인코더(VAE)의 잠재공간에서의 가장 유사한 복제본 탐색이, 기존의 UDA 방법보다 NIR 영상에서 피부 분할 성능을 향상시키는가?
- RQ4타겟 도메인의 레이블에 접근할 수 없음에도 불구하고, 다양한 조도 및 피부 톤 변화에 대해 이 방법은 얼마나 강건한가?
- RQ5타겟 도메인에 대한 어떤 라벨도 없이도, 제안된 방법이 NIR 피부 분할에서 최신 기술 성능을 달성할 수 있는가?
주요 결과
- 제안된 방법은 새로 제작된 두 개의 NIR 피부 분할 데이터셋에서 최신 기술 성능을 달성하며, 기존의 비지도 도메인 적응 방법을 능가한다.
- 잠재공간 내에서의 가장 유사한 복제본 프록시를 활용함으로써, NIR 도메인으로의 효과적인 적응이 가능해지며, 이는 NIR 데이터에 대한 라벨이 전혀 없음에도 불구하고 가능하다.
- 저조도 환경에서 다양한 피부 톤과 조도 조건에 대해 강력한 일반화 성능를 보여준다.
- 이론적 존재성과 실증적 검증을 통해, VAE의 잠재공간에서의 가장 유사한 복제본 탐색 최적화가 타당하고 효과적임을 입증한다.
- 가장 유사한 복제본 프록시에 의해 안내되는, 오직 가시광선 레드채널 데이터에서만 훈련된 분할 네트워크가 NIR 영상으로 효과적으로 일반화된다.
- 결과적으로, 잠재공간 프록시 생성을 통한 타겟 독립적인 UDA는 실세계 저조도 응용 분야에서 NIR 피부 분할에 대해 타당하고 강력한 접근법임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.