Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-domain Human Parsing via Adversarial Feature and Label Adaptation

Si Liu, Yao Sun|arXiv (Cornell University)|2018. 01. 04.
Multimodal Machine Learning Applications참고 문헌 35인용 수 13
한 줄 요약

이 논문은 수동 애너테이션 없이 소스 도메인(예: LIP 데이터셋)에서 사전 학습된 파서를 타겟 도메인으로 적응시키는 크로스도메인 인간 파싱 프레임워크를 제안한다. 적대적 특징 및 구조적 레이블 적응을 통해 도메인 간 특징 이질성과 고차원 레이블 관계를 동시에 최소화하며, 기존의 최고 성능 기준 대비 최대 2% 높은 F-1 스코어를 달성한다.

ABSTRACT

Human parsing has been extensively studied recently due to its wide applications in many important scenarios. Mainstream fashion parsing models focus on parsing the high-resolution and clean images. However, directly applying the parsers trained on benchmarks to a particular application scenario in the wild, e.g., a canteen, airport or workplace, often gives non-satisfactory performance due to domain shift. In this paper, we explore a new and challenging cross-domain human parsing problem: taking the benchmark dataset with extensive pixel-wise labeling as the source domain, how to obtain a satisfactory parser on a new target domain without requiring any additional manual labeling? To this end, we propose a novel and efficient cross-domain human parsing model to bridge the cross-domain differences in terms of visual appearance and environment conditions and fully exploit commonalities across domains. Our proposed model explicitly learns a feature compensation network, which is specialized for mitigating the cross-domain differences. A discriminative feature adversarial network is introduced to supervise the feature compensation to effectively reduce the discrepancy between feature distributions of two domains. Besides, our model also introduces a structured label adversarial network to guide the parsing results of the target domain to follow the high-order relationships of the structured labels shared across domains. The proposed framework is end-to-end trainable, practical and scalable in real applications. Extensive experiments are conducted where LIP dataset is the source domain and 4 different datasets including surveillance videos, movies and runway shows are evaluated as target domains. The results consistently confirm data efficiency and performance advantages of the proposed method for the cross-domain human parsing problem.

연구 동기 및 목표

  • 고품질 벤치마크에서 학습된 모델을 실생활 환경(예: 식당, 공항 등)에 적용할 때 발생하는 도메인 이질성 문제를 해결하기 위해.
  • 풍부한 애너테이션이 있는 소스 도메인에서 애너테이션이 전혀 없는 타겟 도메인으로 효과적으로 적응할 수 있는 방법을 개발하기 위해.
  • 도메인 간 시각적 및 환경적 차이를 최소화하면서도 도메인 간 구조적 레이블 일관성을 유지하기 위해.
  • 실제 환경에 적용 가능한 종단간(end-to-end), 확장성 있고 실용적인 솔루션을 구축하기 위해.

제안 방법

  • 공유된 잠재 공간에서 소스 도메인과 타겟 도메인의 특징을 정렬하기 위한 학습 가능한 특징 보정 네트워크를 도입한다.
  • 구분자 기반 특징 적대망을 활용하여 소스 및 타겟 도메인 특징 표현을 구분하도록 학습시킴으로써 도메인 간 이질성을 감소시킨다.
  • 구조적 레이블 적대망을 통합하여 타겟 예측이 도메인 간 공유되는 고차원 레이블 관계(예: 머리가 몸체 위에 있음)를 따르도록 이끌어낸다.
  • 특징 보정 및 레이블 적응 모듈을 적대적 목표 함수를 통해 공동으로 최적화하여 종단간 최적화를 가능하게 한다.
  • pool5 레이어의 특징을 활용한 다중 척도 감독 전략을 통해 특징 표현의 품질을 향상시킨다.
  • 학습 안정성 향상과 일반화 성능 향상을 위해 레이블 일관성 손실에서 상수 K_C = 5를 사용한다.

실험 결과

연구 질문

  • RQ1수동 애너테이션 없이도 적대적 특징 적응이 크로스도메인 인간 파싱에서 도메인 이질성을 효과적으로 줄일 수 있는가?
  • RQ2구조적 레이블 적대적 훈련이 도메인 간 고차원 의미적 관계(예: 신체 부위 계층 구조)를 유지할 수 있는가?
  • RQ3특징과 레이블을 함께 적응시키는 방식이 단일 모odal 적응 또는 도메인 불변 기반 모델보다 어떻게 성능이 우수한가?
  • RQ4모델이 저해상도, 저조도, 또는 매우 변동성이 큰 실생활 시나리오에 얼마나 잘 일반화되는가?

주요 결과

  • 특징 및 레이블 적응을 조합한 제안된 방법은 PridA 데이터셋에서 평균 F-1 스코어 92.83을 기록하여 'Source Only' 기준보다 1.05% 높고, DANN보다 0.82% 높다.
  • Daily Video 데이터셋에서는 F-1 스코어 87.51을 달성하여 'Target Only' 상한선을 초월했으며, 이는 제한된 훈련 데이터 조건에서도 효과적인 지식 전이가 이루어졌음을 시사한다.
  • PridB 데이터셋에서 'U-body' 카테고리의 경우 F-1 스코어 78.27%를 기록하여 'Source Only'(74.56%) 및 'DANN'(74.79%)보다 3.5% 이상 높게 성과를 냈다.
  • 'Feat. + Lab. Adapt' 변종은 'Feat. Adapt' 또는 'Lab. Adapt' 단독 대비 일관되게 향상되었으며, 공동 최적화의 상호보완적 이점을 입증한다.
  • 정성적 결과에서는 특히 실내 식당 및 감시 영상와 같은 저조도 및 고속도 운동 상황에서 왼쪽/오른쪽 사지 및 헤어 예측 정확도가 향상된 것으로 나타났다.
  • 부분적 가림, 운동 왜곡, 저해상도 입력과 같은 과도한 도전 상황에서도 기존 기준 모델이 실패하는 상황에서도 모델이 효과적으로 대응하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.