Skip to main content
QUICK REVIEW

[논문 리뷰] HumanMAC: Masked Motion Completion for Human Motion Prediction

Ling-Hao Chen, Jiawei Zhang|arXiv (Cornell University)|2023. 02. 07.
Human Pose and Action Recognition인용 수 4
한 줄 요약

HumanMAC는 인간 동작 예측을 위한 새로운 마스킹 동작 보완 프레임워크를 제안한다. 이는 노이즈에서 시퀀스를 생성하도록 훈련된 동작 확산 모델을 기반으로 하며, 관측된 동작에 대한 마스킹 조건부로 DCT 기반 노이즈 제거를 통해 추론 시에 적응한다. 이 방법은 단일 손실, 엔드 투 엔드 훈련, 뛰어난 동작 다양성(희귀 동작 카테고리 전환 포함)을 통해 CMU-MoCap 및 AMASS 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Human motion prediction is a classical problem in computer vision and computer graphics, which has a wide range of practical applications. Previous effects achieve great empirical performance based on an encoding-decoding style. The methods of this style work by first encoding previous motions to latent representations and then decoding the latent representations into predicted motions. However, in practice, they are still unsatisfactory due to several issues, including complicated loss constraints, cumbersome training processes, and scarce switch of different categories of motions in prediction. In this paper, to address the above issues, we jump out of the foregoing style and propose a novel framework from a new perspective. Specifically, our framework works in a masked completion fashion. In the training stage, we learn a motion diffusion model that generates motions from random noise. In the inference stage, with a denoising procedure, we make motion prediction conditioning on observed motions to output more continuous and controllable predictions. The proposed framework enjoys promising algorithmic properties, which only needs one loss in optimization and is trained in an end-to-end manner. Additionally, it accomplishes the switch of different categories of motions effectively, which is significant in realistic tasks, e.g., the animation task. Comprehensive experiments on benchmarks confirm the superiority of the proposed framework. The project page is available at https://lhchen.top/Human-MAC.

연구 동기 및 목표

  • 기존의 인코딩-디코딩 아키텍처의 한계를 해결하기 위해, 복잡한 손실 함수, 다단계 훈련, 동작 카테고리 전환 능력 부족 문제를 해결한다.
  • 인간 동작 예측을 마스킹 보완 작업으로 재고함으로써 제어 가능하고 다양한 동작 예측을 가능하게 한다.
  • 다중 손실 구성 요소의 하이퍼파라미터 튜닝을 피하기 위해 단일 손실 함수와 엔드 투 엔드 최적화를 통해 훈련을 단순화한다.
  • 입력 시퀀스에 존재하지 않더라도 자연스러운 동작 카테고리 전환(예: 걷기에서 앉기로 전환)을 가능하게 하여 현실감과 다양성을 향상시킨다.
  • 관측된 프레임과 예측된 프레임 간의 연속성을 보장하기 위해 전체 동작 시퀀스를 통합적으로 모델링하는 통합 프레임워크를 개발한다.

제안 방법

  • 프레임워크는 훈련 단계에서 랜덤 노이즈에서 인간 동작 시퀀스를 생성하도록 동작 확산 모델을 훈련시킨다.
  • 추론 단계에서 관측된 동작의 노이즈 있는 표현을 디노이징함으로써 마스킹 보완 작업으로 동작 예측을 다룬다.
  • 새로운 DCT-보완 메커니즘은 학습 가능한 마스크를 사용해 디노이징된 스펙트럼 표현과 노이즈 있는 스펙트럼 표현을 조합함으로써 관측된 동작에 조건부로 예측을 유도한다.
  • 이 방법은 동작의 저주파 및 고주파 성분을 모델링하기 위해 이산余弦변환(DCT)을 활용하여 부드러움과 정확도를 향상시킨다.
  • 전체 파ipeline는 다단계 훈련이나 적대적 손실이 필요 없이 단일 복원 손실로 엔드 투 엔드로 훈련된다.
  • 장기 예측을 위해 이전 예측 결과를 반복적으로 조건부로 적용함으로써 자동회귀 방식으로 모델을 적용한다.

실험 결과

연구 질문

  • RQ1마스킹 동작 보완 프레임워크는 기존의 인코딩-디코딩 아키텍처보다 인간 동작 예측에서 더 우수한 성능을 낼 수 있는가?
  • RQ2단일 손실, 엔드 투 엔드 확산 모델이 훈련 단순화와 하이퍼파라미터 튜닝을 줄이며 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ3입력 시퀀스에 존재하지 않더라도 모델이 자연스럽게 동작 카테고리 전환(예: 걷기에서 앉기로 전환)을 생성할 수 있는가?
  • RQ4원시 시간 도메인 모델링 대비 DCT 기반 스펙트럼 모델링은 동작의 부드러움과 정확도를 어떻게 향상시키는가?
  • RQ5다양하고 현실적인 출력을 내기 위해 장기 예측에 일반화 가능한가?

주요 결과

  • HumanMAC는 CMU-MoCap 및 AMASS 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하였으며, CMU-MoCap에서 APD 8.021, ADE 0.433을 기록하여 이전의 VAE 및 확산 기반 모델을 모두 능가한다.
  • AMASS에서 HumanMAC는 APD 9.321, ADE 0.511을 기록하여 다양한 동작 스타일 간 강력한 일반화 능력을 입증한다.
  • 제거 실험을 통해 DCT 모델링이 예측 정확도와 부드러움을 향상시킴을 확인하였으며, DCT 없이 ADE 0.444에서 DCT를 사용할 경우 ADE 0.369로 감소하였다.
  • HumanMAC는 입력 시퀀스에 포함되지 않은 동작 전환(예: 앉기에서 일어나기, 서 있음에서 걷기로 전환)을 자연스럽게 생성할 수 있으며, 다양한 연속적인 동작 전환을 가능하게 한다.
  • 기존의 베이스라인 대비 더 다이나믹하고 과도하게 부드럽지 않은 장기 예측을 생성한다. 기존 모델은 일반적으로 정적 또는 반복적인 동작을 생성하는 경향이 있다.
  • 프레임워크는 단일 손실 함수만을 사용하며 엔드 투 엔드로 훈련되므로, 다단계 훈련이나 복잡한 손실 균형 조정이 필요 없다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.