Skip to main content
QUICK REVIEW

[논문 리뷰] FLEX: Parameter-free Multi-view 3D Human Motion Reconstruction.

Brian Gordon, Sigal Raab|arXiv (Cornell University)|2021. 05. 05.
Human Pose and Action Recognition참고 문헌 48인용 수 4
한 줄 요약

FLEX는 카메라 파라미터에 의존하지 않고, 다중 시야에서 3D 관절 회전과 뼈 길이의 불변성을 학습함으로써 카메라 파라미터에 의존하지 않는 파라미터 없는 엔드 투 엔드 다중 시야 3D 인간 운동 재구성 모델이다. 새로운 다중 시야 융합 레이어를 사용하여 영상 스트림을 통합하고, 시간적으로 일관되고 일관된 3D 골격을 재구성하며, 카메라 파라미터가 제공되지 않은 상태에서 최신 기술을 능가하지만, 파라미터가 제공될 경우 그 성능를 근사한다.

ABSTRACT

The increasing availability of video recordings made by multiple cameras has offered new means for mitigating occlusion and depth ambiguities in pose and motion reconstruction methods. Yet, multi-view algorithms strongly depend on camera parameters, in particular, the relative positions among the cameras. Such dependency becomes a hurdle once shifting to dynamic capture in uncontrolled settings. We introduce FLEX (Free muLti-view rEconstruXion), an end-to-end parameter-free multi-view model. FLEX is parameter-free in the sense that it does not require any camera parameters, neither intrinsic nor extrinsic. Our key idea is that the 3D angles between skeletal parts, as well as bone lengths, are invariant to the camera position. Hence, learning 3D rotations and bone lengths rather than locations allows predicting common values for all camera views. Our network takes multiple video streams, learns fused deep features through a novel multi-view fusion layer, and reconstructs a single consistent skeleton with temporally coherent joint rotations. We demonstrate quantitative and qualitative results on the Human3.6M and KTH Multi-view Football II datasets. We compare our model to state-of-the-art methods that are not parameter-free and show that in the absence of camera parameters, we outperform them by a large margin while obtaining comparable results when camera parameters are available. Code, trained models, video demonstration, and additional materials will be available on our project page.

연구 동기 및 목표

  • 통제되지 않은 동적인 환경에서 정밀한 카메라 파라미터에 의존하는 다중 시야 3D 인간 운동 재구성 방법의 한계를 해결하기 위해.
  • 내부 및 외부 카메라 파라미터에 대한 의존성을 제거하여 실제 세계의 제약 없는 환경에서의 구현을 가능하게 하기 위해.
  • 카메라 캘리브레이션 없이도 다중 영상 스트림에서 일관되고 시간적으로 일관된 3D 인간 골격을 재구성할 수 있는 통합형 엔드 투 엔드 모델을 개발하기 위해.
  • 다양한 카메라 시점에서 3D 관절 각도와 뼈 길이와 같은 기하학적 불변성을 활용하여 정확성과 일반화 능력을 향상시키기 위해.

제안 방법

  • FLEX는 여러 카메라 시점 간의 3D 관절 회전과 뼈 길이를 불변 특징으로 학습하여 3D 관절 위치의 필요성을 회피한다.
  • 다양한 영상 스트림의 깊이 특징을 공유 표현으로 통합하기 위해 새로운 다중 시야 융합 레이어를 활용한다.
  • 단일이고 일관된 3D 골격 시퀀스를 시간적 일관성 있게 재구성하도록 엔드 투 엔드로 훈련한다.
  • 다른 카메라 시점에서 3D 관절 각도와 뼈 길이의 기하학적 불변성을 활용하여 다양한 시점 예측을 통합한다.
  • 명시적인 카메라 파라미터 감독 없이도 모든 카메라 시점에서 일관된 3D 자세 추정을 보장하기 위해 시아미즈 유사 아키텍처를 사용한다.
  • 부드럽고 현실적인 운동 시퀀스를 보장하기 위해 3D 관절 키포인트 회귀와 시간적 일관성 손실의 조합으로 훈련한다.

실험 결과

연구 질문

  • RQ1내부 또는 외부 캘리브레이션과 같은 카메라 파라미터에 의존하지 않고도 3D 인간 운동 재구성을 달성할 수 있는가?
  • RQ2내가 캘리브레이션되지 않은 카메라에서 다중 시야 예측을 통합하는 데 있어 기하학적 불변성—특히 3D 관절 각도와 뼈 길이—를 어떻게 활용할 수 있는가?
  • RQ3파라미터 없는 모델이 통제되지 않은 동적인 환경에서 카메라 파라미터가 필요한 최신 기술 대비 얼마나 뛰어난 성능을 보일 수 있는가?
  • RQ4딥 러닝 모델이 캘리브레이션되지 않은 다중 영상 스트림에서 일관되고 시간적으로 일관된 3D 운동 재구성을 달성할 수 있는가?

주요 결과

  • FLEX는 Human3.6M 및 KTH Multi-view Football II 데이터셋에서 카메라 파라미터가 제공되지 않은 상황에서 최신 기술을 능가한다.
  • 카메라 파라미터가 제공될 경우, FLEX는 기존의 최고 성능를 내는 파라미터 의존 모델과 유사한 성능을 달성한다.
  • 파라미터 없는 설계와 기하학적 불변성에 기반함으로써, 통제되지 않은 동적인 환경에서도 뛰어난 강건성을 보여준다.
  • 새로운 다중 시야 융합 레이어의 사용은 다양한 시점 간의 효과적인 특징 통합을 가능하게 하여 재구성 정확도를 향상시킨다.
  • 시간적 일관성 손실은 재구성된 운동 시퀀스의 부드러움과 현실감을 크게 향상시킨다.
  • 다양한 카메라 구성에 걸쳐 잘 일반화됨을 확인하였으며, 이는 3D 회전과 뼈 길이의 불변성 학습이 효과적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.