Skip to main content
QUICK REVIEW

[논문 리뷰] PoseAug: A Differentiable Pose Augmentation Framework for 3D Human Pose Estimation

Kehong Gong, Jianfeng Zhang|arXiv (Cornell University)|2021. 05. 06.
Human Pose and Action Recognition참고 문헌 53인용 수 13
한 줄 요약

PoseAug는 모델 학습 피드백을 통해 기하학적 증강(자세, 신체 크기, 시점, 위치)을 통해 훈련 데이터의 다양성을 학습하는 가분산(end-to-end) 자동 증강 프레임워크이다. 이는 3D 인간 자세 추정의 일반화 성능을 향상시키며, 교차 데이터셋 평가에서 MPI-INF-3DHP에서 3D PCK를 88.6%로 9.1% 향상시켰다.

ABSTRACT

Existing 3D human pose estimators suffer poor generalization performance to new datasets, largely due to the limited diversity of 2D-3D pose pairs in the training data. To address this problem, we present PoseAug, a new auto-augmentation framework that learns to augment the available training poses towards a greater diversity and thus improve generalization of the trained 2D-to-3D pose estimator. Specifically, PoseAug introduces a novel pose augmentor that learns to adjust various geometry factors (e.g., posture, body size, view point and position) of a pose through differentiable operations. With such differentiable capacity, the augmentor can be jointly optimized with the 3D pose estimator and take the estimation error as feedback to generate more diverse and harder poses in an online manner. Moreover, PoseAug introduces a novel part-aware Kinematic Chain Space for evaluating local joint-angle plausibility and develops a discriminative module accordingly to ensure the plausibility of the augmented poses. These elaborate designs enable PoseAug to generate more diverse yet plausible poses than existing offline augmentation methods, and thus yield better generalization of the pose estimator. PoseAug is generic and easy to be applied to various 3D pose estimators. Extensive experiments demonstrate that PoseAug brings clear improvements on both intra-scenario and cross-scenario datasets. Notably, it achieves 88.6% 3D PCK on MPI-INF-3DHP under cross-dataset evaluation setup, improving upon the previous best data augmentation based method by 9.1%. Code can be found at: https://github.com/jfzhang95/PoseAug.

연구 동기 및 목표

  • 제한된 훈련 데이터 다양성으로 인해 3D 인간 자세 추정기의 분포 외(out-of-distribution) 및 실외(in-the-wild) 데이터셋에 대한 일반화 성능이 열 劣하다는 문제를 해결하기 위해.
  • 고정된 규칙에 의존하고 모델 학습 동역학에 적응하지 못하는 기존 오프라인 데이터 증강 방법의 한계를 극복하기 위해.
  • 데이터 증강과 자세 추정이 훈련 손실을 피드백으로 공동 최적화하는 엔드 투 엔드 학습 가능한 프레임워크를 개발하기 위해.
  • 부분 인식 운동학 사슬 감시를 통한 판별 모듈을 도입하여 증강된 자세가 기하학적으로 타당성을 유지하도록 보장하기 위해.
  • 특히 교차 데이터셋 평가 설정에서 다양한 시나리오에 걸쳐 모델의 강인성을 향상시키기 위해.

제안 방법

  • 신경망 연산을 통해 뼈대 관절 각도, 신체 크기, 시점/위치를 학습하여 수정하는 가분산 자세 증강기를 도입하기 위해.
  • 자세 추정기의 훈련 손실을 증강기로 역전파하여 증강기가 더 다양한 도전적인 자세를 생성하도록 이끌 수 있도록 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 증강 과정에서 국소 관절 각도의 타당성을 강제하기 위해 부분 인식 운동학 사슬 공간(PA-KCS)을 사용한 3D 자세 판별기를 설계하기 위해.
  • 증강된 자세의 신체 크기, 시점, 공간적 위치의 타당성을 확보하기 위해 2D 자세 판별기를 구현하기 위해.
  • 증강기, 추정기, 판별기를 공동 최적화 기반으로 통합하여 데이터 다양성과 모델 일반화 성능을 향상시키기 위해.
  • 추정 오차가 증가할수록 증강기가 더 복잡하고 다양한 자세를 생성하도록 피드백 루프를 설계하여 훈련 난이도를 적응적으로 향상시키기 위해.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 피드백 기반 데이터 증강이 기존 오프라인 증강 방식을 초월하여 3D 인간 자세 추정기의 일반화 성능을 향상시킬 수 있는가?
  • RQ2규칙 기반 또는 수작업으로 설계된 방법과 비교해 볼 때, 가분산 증강기가 다양한 2D-3D 자세 쌍을 얼마나 효과적으로 생성하는가?
  • RQ3부분 인식 운동학 사슬 공간을 통한 타당성 강제가 증강된 자세의 품질과 후속 모델 성능에 얼마나 기여하는가?
  • RQ4증강과 추정의 공동 최적화가 교차 데이터셋 일반화에 실제로 측정 가능한 성과 향상 효과를 가져오는가, 특히 실외 벤치마크에서?
  • RQ5프레임워크의 개별 구성 요소(예: RT 연산, 판별기)가 도전적인 데이터셋에서 성능 향상에 기여하는 정도는 어느 정도인가?

주요 결과

  • PoseAug는 교차 데이터셋 평가에서 MPI-INF-3DHP에서 3D PCK를 88.6%로 기록하여 이전 최고 성능 데이터 증강 방법 대비 9.1% 향상시켰다.
  • 3DHP에서는 MPJPE를 86.6에서 73.0으로 13.6점 향상시키고, H36M에서는 41.8에서 38.2로 3.6점 향상시켜 내부 및 교차 시나리오 설정 모두에서 뚜렷한 성과 향상을 보였다.
  • RT 연산(시점 및 위치 증강)이 교차 시나리오 성능 향상에 가장 기여하였으며, 모든 구성 요소를 사용했을 때 3DHP에서 MPJPE가 13.1점 감소했다.
  • 부분 인식 KCS를 사용한 3D 자세 판별기는 표준 KCS보다 우수했으며, 3DPW에서 MPJPE를 13.0점 감소시키고 3DHP에서는 13.6점 감소시켜 그 효과를 확인했다.
  • 2D 및 3D 판별기를 모두 추가하면 3DHP에서 MPJPE가 13.6점 감소하여 타당성 안내가 효과적인 증강에 필수적임을 입증했다.
  • 다양성 분석 결과, PoseAug는 기준 및 이전 방법 대비 특히 도전적인 실외 시나리오에서 시점과 위치의 분포를 크게 확장함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.