Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond Appearance: a Semantic Controllable Self-Supervised Learning Framework for Human-Centric Visual Tasks

Weihua Chen, Xianzhe Xu|arXiv (Cornell University)|2023. 03. 30.
Human Pose and Action Recognition인용 수 4
한 줄 요약

SOLIDER는 인간 이미지에서의 사전 지식을 활용하여 허위 의미 레이블을 생성함으로써 의미 제어가 가능한 자기지도 학습 프레임워크이다. 이는 풍부한 의미 정보를 포함하는 일반적인 인간 표현을 학습하는 데 기여한다. 의미 제어기와 조건부 네트워크를 도입함으로써 SOLIDER는 조정 가능한 의미-외형 비율을 가진 적응형 표현을 생성하며, 여섯 가지 인간 중심 시각 작업에서 최신 기술을 초월하여 모든 평가 기준에서 새로운 베이스라인을 수립한다.

ABSTRACT

Human-centric visual tasks have attracted increasing research attention due to their widespread applications. In this paper, we aim to learn a general human representation from massive unlabeled human images which can benefit downstream human-centric tasks to the maximum extent. We call this method SOLIDER, a Semantic cOntrollable seLf-supervIseD lEaRning framework. Unlike the existing self-supervised learning methods, prior knowledge from human images is utilized in SOLIDER to build pseudo semantic labels and import more semantic information into the learned representation. Meanwhile, we note that different downstream tasks always require different ratios of semantic information and appearance information. For example, human parsing requires more semantic information, while person re-identification needs more appearance information for identification purpose. So a single learned representation cannot fit for all requirements. To solve this problem, SOLIDER introduces a conditional network with a semantic controller. After the model is trained, users can send values to the controller to produce representations with different ratios of semantic information, which can fit different needs of downstream tasks. Finally, SOLIDER is verified on six downstream human-centric visual tasks. It outperforms state of the arts and builds new baselines for these tasks. The code is released in https://github.com/tinyvision/SOLIDER.

연구 동기 및 목표

  • 다양한 후행 인간 중심 시각 작업에 유익한 막대한 무라벨 인간 이미지에서 일반적이고 일반화 가능한 인간 표현을 학습하는 것.
  • 자기지도 학습 기법이 충분한 의미 정보를 포착하지 못하는 한계를 해결하여, 파싱 및 속성 인식과 같은 고수준 이해가 필요한 작업에 특화하는 것.
  • 학습된 표현에서 의미 정보와 외형 정보 비율을 후행 작업 요구사항에 맞게 유연하게 조정할 수 있도록 하는 것.
  • 다양한 후행 응용 분야에 적합한 새로운 강력한 기준이 되는 사전 학습 모델을 개발하는 것.

제안 방법

  • SOLIDER는 인간 이미지의 사전 지식에서 유도된 허위 의미 레이블을 사용하여 토큰 수준의 의미 분류 사전 과제를 도입한다. 예를 들어 신체 부위(예: 상체, 신발)와 같은 정보를 활용한다.
  • 의미 공간으로 특징를 매핑하기 위해 학습 가능한 투영 헤드를 갖춘 비전 트랜스포머 기반 모델을 활용하며, 이는 허위 레이블에 의해 지도되어 의미 인식 능력을 향상시킨다.
  • 조건부 네트워크 아키텍처에 의미 제어기를 통합하여 사용자가 스칼라 값을 입력해 최종 표현의 의미 대비 외형 비율을 제어할 수 있도록 한다.
  • 추론 중 특징 공간을 조절함으로써 재학습 없이도 실시간으로 표현 구성의 적응을 가능하게 한다.
  • 대규모 LUPerson 데이터셋(418만 장)을 기반으로 프리트레인을 수행하며, 마스킹 오토에인코딩과 새로운 의미 사전 과제를 포함한 대비 학습을 사용한다.
  • 최종 표현은 표준 헤드 아키텍처를 사용하여 후행 작업에서 파인튜닝되며, 여섯 가지 인간 중심 작업에서 성능을 평가한다.
Figure 1 : A representation space learned by DINO [ 6 ] . Seven human images are represented in seven different colors. Each image is split into four parts according to their semantic regions, i.e . , upper body (as $\blacktriangle$ ), lower body (as + ), shoes (as $\star$ ) and background (as $\tim
Figure 1 : A representation space learned by DINO [ 6 ] . Seven human images are represented in seven different colors. Each image is split into four parts according to their semantic regions, i.e . , upper body (as $\blacktriangle$ ), lower body (as + ), shoes (as $\star$ ) and background (as $\tim

실험 결과

연구 질문

  • RQ1인간 이미지에서의 사전 지식가 허위 의미 레이블 생성에 효과적으로 활용될 수 있는가?
  • RQ2기존의 대비 학습 또는 마스킹 오토에인코딩 방법에 비해 더 강력한 의미 정보를 포함하는 표현을 학습할 수 있는가?
  • RQ3단일 사전 학습 모델이 다양한 후행 인간 중심 작업에 적합한 조정 가능한 의미-외형 비율의 표현을 생성할 수 있는가?
  • RQ4제안된 의미 제어기가 고정된 표현 기반 모델에 비해 여러 인간 중심 시각 작업에서 더 뛰어난 성능을 내는가?

주요 결과

  • SOLIDER는 사람 재식별, 속성 인식, 사람 검색, 보행자 검출, 인간 파싱, 자세 추정을 포함한 여섯 가지 인간 중심 시각 작업에서 새로운 최고 성능을 기록했다.
  • PETA zero-shot 속성 인식 벤치마크에서, SOLIDER는 Swin-B를 사용해 76.43%의 정확도를 기록했으며, 이는 이전 최고 성능보다 2.12% 높은 성능이다.
  • PRW에서의 사람 검색 작업에서, SOLIDER는 59.8%의 mAP를 달성하여 이전 최고 성능 방법에 비해 12%의 상대적 향상률을 보였다.
  • Cityscapes에서의 보행자 검출 작업에서, SOLIDER는 Swin-S를 사용해 9.7%의 MR-2와 39.4%의 H-O 성능을 기록했으며, 유사한 설정에서 이전 방법들을 압도했다.
  • LIP에서의 인간 파싱 작업에서, SOLIDER는 Swin-S를 사용해 60.21%의 mIOU를 기록했으며, 이는 이전 최고 성능보다 2.69% 향상된 결과이다.
  • 비-re-ID 작업 다섯 가지의 평균 성능은 DINO-LUP1M의 72.6에서 SOLIDER의 74.9로 향상되었으며, 이는 향상된 의미 학습의 일관된 이점을 입증한다.
Figure 2 : The pipeline of the proposed SOLIDER.
Figure 2 : The pipeline of the proposed SOLIDER.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.