Skip to main content
QUICK REVIEW

[논문 리뷰] Keypoint Based Weakly Supervised Human Parsing

Zhonghua Wu, Guosheng Lin|arXiv (Cornell University)|2018. 09. 14.
Advanced Neural Network Applications참고 문헌 17인용 수 3
한 줄 요약

이 논문은 비용이 많이 드는 픽셀 수준의 레이블 대신 오직 객체 관건점(annotation)만을 사용하여 경쟁적인 성능을 달성하는 약한 감독형 인간 파싱 방법을 제안한다. 반복적인 가짜 마스크 생성 과정과 공동 부분-객체 세분화를 위한 상관관계 네트워크를 활용함으로써 레이블링 노력은 줄이고, 완전 감독 기반 결과와 비슷한 성능을 내며 약 10%의 성능 저하만을 보인다.

ABSTRACT

Fully convolutional networks (FCN) have achieved great success in human parsing in recent years. In conventional human parsing tasks, pixel-level labeling is required for guiding the training, which usually involves enormous human labeling efforts. To ease the labeling efforts, we propose a novel weakly supervised human parsing method which only requires simple object keypoint annotations for learning. We develop an iterative learning method to generate pseudo part segmentation masks from keypoint labels. With these pseudo masks, we train an FCN network to output pixel-level human parsing predictions. Furthermore, we develop a correlation network to perform joint prediction of part and object segmentation masks and improve the segmentation performance. The experiment results show that our weakly supervised method is able to achieve very competitive human parsing results. Despite our method only uses simple keypoint annotations for learning, we are able to achieve comparable performance with fully supervised methods which use the expensive pixel-level annotations.

연구 동기 및 목표

  • 인간 파싱에서 픽셀 수준의 레이블에 대한 높은 인간 레이블링 비용을 줄이기 위해 오직 객체 관건점(annotation)을 감독으로 사용하는 것.
  • 희소한 관건점(annotation) 레이블로부터 고품질의 가짜 세분화 마스크를 생성하여 완전 컨volution 네트워크(FCN)를 훈련하는 방법을 개발하는 것.
  • 공동 학습을 통해 부분과 객체 세분화 간의 강한 상관관계를 모델링하여 부분 세분화 성능을 향상시키는 것.
  • 실제 적용 가능성을 높이기 위해 인간 레이블링과 모델 예측 관건점(annotation, 예: Mask R-CNN 또는 AlphaPose)을 모두 사용하여 훈련할 수 있도록 하는 것.
  • 약한 감독 학습에서 관건점(annotation)을 감독으로 사용할 경우 완전 감독 방법과 비슷한 성능을 달성할 수 있음을 보여주는 것.

제안 방법

  • 관건점(annotation) 레이블을 사용하여 그래프 컷 기반의 가짜 마스크 생성을 위한 초기 전경 및 배경 영역을 정의하며, 전경 영역은 관건점(annotation) 레이블과 연결 관계에서 유도된다.
  • 관건점(annotation) 제약 조건을 사용하여 FCN 예측과 그래프 컷 최적화를 번갈아 적용함으로써 반복적인 개선 과정을 통해 가짜 마스크 품질을 향상시킨다.
  • 생성된 가짜 마스크를 사용하여 VGG-16 백본을 갖는 DeepLab 기반의 FCN을 훈련하며, 객체, 부분, 개선된 부분 세분화 손실을 동일한 가중치로 최적화한다.
  • 부분과 객체 예측 간의 상호작용을 모델링하기 위해 네트워크에 상관관계 블록(correlation block)을 도입하여 세분화 일致성과 정확도를 향상시킨다.
  • 테스트 시기 관건점(annotation) 예측값(예: Mask R-CNN 또는 AlphaPose에서 유도)을 그래프 컷 최적화에 통합하여 세분화 결과를 추가로 개선한다.
  • 그래프 컷의 세밀함과 안정성을 향상시키기 위해 최소 구성 요소 크기가 60인 슈퍼픽셀 세분화를 사용한다.

실험 결과

연구 질문

  • RQ1픽셀 수준의 마스크 대신 오직 객체 관건점(annotation) 레이블만을 사용하여 인간 파싱을 효과적으로 훈련시킬 수 있는가?
  • RQ2희소한 관건점(annotation) 레이블로부터 고품질의 감독 정보로 전환하기 위해 반복적인 가짜 마스크 생성 방법이 얼마나 효과적인가?
  • RQ3독립적인 예측과 비교하여 부분과 객체 세분화의 공동 학습이 파싱 성능 향상에 얼마나 기여하는가?
  • RQ4제안된 방법이 Mask R-CNN 및 AlphaPose와 같은 사전 훈련된 검출기에서 유도된 낮은 품질의 관건점(annotation) 예측값에도 일반화 가능한가?
  • RQ5테스트 시기 관건점(annotation) 예측값을 그래프 컷 최적화에 통합함으로써 세분화 정확도가 추가로 향상되는가?

주요 결과

  • 제안된 약한 감독 방법은 PASCAL VOC Human Part 데이터셋에서 평균 IoU 67.8%를 달성하였으며, 동일한 VGG-16 백본을 사용한 완전 감독 기반 기준선 대비 약 10% 이내의 성능을 보였다.
  • 가짜 마스크의 반복적 개선 과정은 IoU 성능 향상을 이끌었으며, 3회 반복 후 수렴함을 확인하여 효과적인 마스크 개선이 이루어졌음을 시사한다.
  • 공동 부분-객체 학습을 위한 상관관계 블록은 부분 세분화 IoU를 향상시켜, 상호의존성을 모델링함으로써 세분화 정확도 향상이 가능함을 입증한다.
  • 이 방법은 인간 레이블링 데이터셋(예: PASCAL VOC Human Pose)과 사전 훈련된 검출기(Mask R-CNN, AlphaPose)에서 유도된 관건점(annotation) 레이블을 모두 효과적으로 활용하여, 정확도가 낮은 입력 관건점(annotation)이어도 경쟁 가능한 성능을 달성하였다.
  • 테스트 시기 관건점(annotation) 예측값을 그래프 컷 최적화에 통합함으로써 성능 향상이 뚜렷하게 발생하였으며, 추론 시 동적 관건점(annotation) 통합의 가치를 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.