[논문 리뷰] Boosting Semantic Human Matting with Coarse Annotations
이 논문은 트림랩이 필요 없이 종단 간 의미적 인간 마티네이션 성능을 햖저하기 위해 굵은 및 세밀한 인간 애너테이션을 동시에 활용하는 새로운 프레임워크를 제안한다. 하이브리드 데이터로 마스크 예측 네트워크를 훈련하고, 품질 통일 네트워크를 적용하여 마스크 품질을 표준화한 후, 마티네이션 개선 네트워크로 결과를 보완함으로써, 고가의 고품질 애너테이션에 대한 필요성을 크게 줄이며 최신 기술 수준의 성능을 달성한다.
Semantic human matting aims to estimate the per-pixel opacity of the foreground human regions. It is quite challenging and usually requires user interactive trimaps and plenty of high quality annotated data. Annotating such kind of data is labor intensive and requires great skills beyond normal users, especially considering the very detailed hair part of humans. In contrast, coarse annotated human dataset is much easier to acquire and collect from the public dataset. In this paper, we propose to use coarse annotated data coupled with fine annotated data to boost end-to-end semantic human matting without trimaps as extra input. Specifically, we train a mask prediction network to estimate the coarse semantic mask using the hybrid data, and then propose a quality unification network to unify the quality of the previous coarse mask outputs. A matting refinement network takes in the unified mask and the input image to predict the final alpha matte. The collected coarse annotated dataset enriches our dataset significantly, allows generating high quality alpha matte for real images. Experimental results show that the proposed method performs comparably against state-of-the-art methods. Moreover, the proposed method can be used for refining coarse annotated public dataset, as well as semantic segmentation methods, which reduces the cost of annotating high quality human data to a great extent.
연구 동기 및 목표
- 특히 머리카락과 같은 세부 사항에 대해 고가의 고품질 인간 알파 마티네이션 애너테이션을 제작하는 데 드는 높은 비용과 어려움을 해결하기 위해.
- 의미적 인간 마티네이션에서 고비용의 사용자 인터랙티브 트림랩에 대한 의존도를 줄이기 위해.
- 수집이 용이한 거친 애너테이션 데이터셋을 활용하여 마티네이션 성능을 향상시키기 위해.
- 명시적인 트림랩 감독 없이도 낮은 품질의 또는 거친 마스크에서 고품질의 마티네이션을 생성할 수 있는 프레임워크를 개발하기 위해.
- 공개된 거친 애너테이션 데이터셋과 의미적 세그멘테이션 출력을 정밀한 알파 마티네이션으로 개선하는 실용적인 솔루션을 제공하기 위해.
제안 방법
- 세밀한 인간 애너테이션과 거친 애너테이션의 하이브리드 데이터셋을 기반으로, 저해상도 의미적 마스크를 예측하는 마스크 예측 네트워크(MPN)를 훈련한다.
- MPN 출력의 품질을 다양한 입력 이미지 간에 표준화하기 위해 품질 통일 네트워크(QUN)를 도입한다. 이는 최종 보정을 위한 일관된 입력을 보장한다.
- 통합된 거친 마스크와 원본 이미지를 입력으로 받아 최종 고정밀도 알파 마티네이션을 예측하는 마티네이션 개선 네트워크(MRN)를 사용한다.
- MPN과 QUN은 거친 데이터와 세밀한 데이터 양쪽 모두를 사용해 훈련되며, MRN는 세밀한 애너테이션 데이터에만 전적으로 훈련되어 세부 사항의 정확성을 유지한다.
- 기존의 거친 애너테이션 데이터셋과 의미적 세그멘테이션 출력과의 호환성을 고려해 설계되어 종단 간 개선을 가능하게 한다.
- 세 단계 파이프라인을 사용한다: 거친 마스크 예측 → 품질 표준화 → 고해상도 마티네이션 개선. 이 모든 과정에서 트림랩 입력이 필요 없다.
실험 결과
연구 질문
- RQ1트림랩이 필요 없이 거친 애너테이션 데이터를 효과적으로 활용하여 의미적 인간 마티네이션 성능을 향상시킬 수 있는가?
- RQ2다양한 품질의 거친 마스크에서 발생하는 품질의 이질성을 어떻게 통일시켜 강력한 마티네이션 개선을 가능하게 할 수 있는가?
- RQ3제한된 세밀한 데이터로 훈련된 모델이 풍부한 거친 데이터를 통합함으로써 잘 일반화될 수 있는가?
- RQ4제안된 방법이 낮은 품질의 공개 애너테이션 또는 세그멘테이션 출력을 얼마나 정밀한 알파 마티네이션으로 개선할 수 있는가?
- RQ5품질 통일 네트워크가 원시 거친 마스크를 직접 개선하는 것보다 마티네이션 성능을 크게 향상시키는가?
주요 결과
- 제안된 방법은 트림랩 입력 없이도 의미적 인간 마티네이션 분야에서 최신 기술 수준의 성능을 달성한다.
- 표 2의 정량적 지표에 따르면, 세밀한 애너테이션 데이터만으로 훈련하는 것에 비해 거친 애너테이션 데이터의 포함이 성능 향상에 상당한 기여를 한다.
- 품질 통일 네트워크(QUN)는 강력한 마티네이션을 위해 필수적이다. 표 1의 지표에 따르면, QUN을 제거할 경우 성능 저하가 뚜렷하게 나타난다.
- PASCAL 및 COCO와 같은 공개 데이터셋의 거친 마스크를 성공적으로 개선하여, 머리카락과 같은 도전적인 세부 사항까지도 고품질 알파 마티네이션을 생성한다.
- DeepLab과 같은 의미적 세그멘테이션 모델의 출력을 효과적으로 향상시켜, 원래 예측에서 누락되었던 세밀한 디테일을 복구한다.
- 세밀한 애너테이션과 거친 애너테이션을 결합한 수집된 하이브리드 데이터셋 덕분에, 다양한 실제 이미지에 대해 모델이 잘 일반화됨을 그림 7을 통해 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.