Skip to main content
QUICK REVIEW

[논문 리뷰] Human Motion Analysis with Deep Metric Learning

Huseyin Coskun, David Joseph Tan|arXiv (Cornell University)|2018. 07. 30.
Human Pose and Action Recognition참고 문헌 28인용 수 5
한 줄 요약

이 논문은 가변 길이의 운동 시퀀스에서 의미 있는 임bedding을 학습하기 위해 새로운 MMD-NCA 손실과 주의 메커니즘을 갖춘 RNN을 사용하는 딥 메트릭 학습 프레임워크를 제안한다. 분포 수준의 지도 학습과 주의 메커니즘을 활용하여 행동 검색 및 인물 식별에서 최신 기술 수준의 성능을 달성하였으며, 기존의 DTW와 L2와 같은 일반적인 메트릭과 비교해 거짓 양성률을 최대 20% 감소시켰다.

ABSTRACT

Effectively measuring the similarity between two human motions is necessary for several computer vision tasks such as gait analysis, person identi- fication and action retrieval. Nevertheless, we believe that traditional approaches such as L2 distance or Dynamic Time Warping based on hand-crafted local pose metrics fail to appropriately capture the semantic relationship across motions and, as such, are not suitable for being employed as metrics within these tasks. This work addresses this limitation by means of a triplet-based deep metric learning specifically tailored to deal with human motion data, in particular with the prob- lem of varying input size and computationally expensive hard negative mining due to motion pair alignment. Specifically, we propose (1) a novel metric learn- ing objective based on a triplet architecture and Maximum Mean Discrepancy; as well as, (2) a novel deep architecture based on attentive recurrent neural networks. One benefit of our objective function is that it enforces a better separation within the learned embedding space of the different motion categories by means of the associated distribution moments. At the same time, our attentive recurrent neural network allows processing varying input sizes to a fixed size of embedding while learning to focus on those motion parts that are semantically distinctive. Our ex- periments on two different datasets demonstrate significant improvements over conventional human motion metrics.

연구 동기 및 목표

  • 기존의 L2 및 DTW와 같은 전통적 운동 유사도 메트릭이 인간 운동 시퀀스 내의 의미적 및 맥락적 관계를 포착하지 못하는 한계를 해결하기 위해.
  • 명시적인 시퀀스 정렬이 필요 없이 의미적으로 유사한 운동을 임bedding 공간에서 가까이 위치시키는 딥 메트릭 학습 프레임워크를 설계하기 위해.
  • 주의 보강된 순환 구조를 사용하여 가변 길이의 운동 시퀀스로부터 효과적으로 학습할 수 있도록 하기 위해.
  • 분포 기반 손실 지도 학습을 통해 하드 네거티브 마이닝이 필요 없어지면서 계산 비용을 절감하기 위해.
  • 행동 검색 및 운동 기반 인물 식별과 같은 후행 작업에서 성능 향상을 이루기 위해.

제안 방법

  • 최대 평균 불일치(MMD) 기반으로 설계된 새로운 MMD-NCA 손실 함수를 도입하여 운동 카테고리의 분포 모멘트를 기반으로 분리함으로써 하드 네거티브 마이닝을 피함.
  • 의미적으로 구별되는 자세 패턴에 초점을 맞추어 가변 길이의 운동 시퀀스를 처리하고 고정 크기의 임bedding을 생성하기 위해 주의 메커니즘을 갖춘 순환 신경망(RNN)을 활용.
  • 전체 운동 분포를 개별 샘플이 아닌 비교하기 위해 커널화된 MMD 목표를 갖춘 트리플릿 기반 아키텍처를 사용.
  • 학습 안정성 향상과 특징 표현 학습 향상을 위해 레이어 정규화와 자기 주의 메커니즘을 적용.
  • 임베딩 품질에 미치는 고차수 통계 모멘트의 영향을 탐색하기 위해 MMD-NCA 손실에 다양한 커널 함수(선형, 다항식, RBF)를 활용.
  • 기본, 양성(동일 클래스), 음성(다른 클래스)의 운동 시퀀스 트리플릿을 대상으로 대비 학습을 통해 모델을 엔드 투 엔드로 훈련.

실험 결과

연구 질문

  • RQ1분포 수준의 지도 학습에 기반한 딥 메트릭 학습 접근법이 기존의 L2 및 DTW와 같은 운동 유사도 메트릭보다 의미 관계를 더 잘 포착할 수 있는가?
  • RQ2주의 보강된 RNN 아키텍처는 가변 길이의 인간 운동 시퀀스로부터 고정 크기의 임bedding을 학습하는 데 얼마나 효과적인가?
  • RQ3MMD 기반 손실을 통해 하드 네거티브 마이닝을 제거하면 운동 유사도 작업의 학습 효율성과 성능 향상에 기여하는가?
  • RQ4MMD-NCA 손실의 커널 함수 선택이 학습된 운동 임bedding의 품질에 어느 정도의 영향을 미치는가?
  • RQ5제안된 방법은 행동 검색 및 운동 기반 인물 식별에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 주의 메커니즘이 있는 MMD-NCA 손실은 CMU Mocap 데이터셋에서 DTW, MDDTW, CTW, GDTW와 비교해 거짓 양성률(FPR)을 20% 감소시켰다.
  • CMU Mocap 데이터셋에서 최신 기술 수준의 딥 러닝 베이스라인보다 FPR-70 기준 2% 향상되어 더 높은 인물 식별 정확도를 입증했다.
  • 자기 주의 메커니즘을 제거하면 성능 저하가 가장 크게 발생하여 NMI 및 F1 점수가 크게 감소하였으며, 이는 주의 메커니즘이 구별 가능한 운동 부분을 포착하는 데 핵심적인 역할을 함을 시사한다.
  • 레이어 정규화와 자기 주의 메커니즘이 각각 FPR에 약 7% 및 10% 향상 기여하여, 모델 안정성과 표현 품질 향상에 중요한 역할을 함을 보여주었다.
  • MMD-NCA 손실에서 다항식 및 RBF 커널이 선형 커널보다 더 우수한 성능을 보였으며, 이는 운동 분포의 고차수 모멘트가 임베딩 품질 향상에 기여함을 시사한다.
  • 주의 시각화 결과는 모델이 볼 던지기와 같은 운동 단계나 걸음걸이에서의 구부림과 같은 의미적으로 구별되는 운동 단계에 성공적으로 초점을 맞추며, 정보가 적은 프레임은 무시함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.