Skip to main content
QUICK REVIEW

[論文レビュー] Human Motion Analysis with Deep Metric Learning

Huseyin Coskun, David Joseph Tan|arXiv (Cornell University)|Jul 30, 2018
Human Pose and Action Recognition参考文献 28被引用数 5
ひとこと要約

本論文は、変動長の動き系列から意味的に意味のある埋め込みを学習するための深層メトリクス学習フレームワークを提案する。新規のMMD-NCA損失関数と注意メカニズムを備えたRNNを用い、分布レベルの監視と注目機構を活用することで、行動検索および人物識別において最先端の性能を達成し、従来のメトリクス(DTW や L2)と比較して誤検出率を最大20%まで低減した。

ABSTRACT

Effectively measuring the similarity between two human motions is necessary for several computer vision tasks such as gait analysis, person identi- fication and action retrieval. Nevertheless, we believe that traditional approaches such as L2 distance or Dynamic Time Warping based on hand-crafted local pose metrics fail to appropriately capture the semantic relationship across motions and, as such, are not suitable for being employed as metrics within these tasks. This work addresses this limitation by means of a triplet-based deep metric learning specifically tailored to deal with human motion data, in particular with the prob- lem of varying input size and computationally expensive hard negative mining due to motion pair alignment. Specifically, we propose (1) a novel metric learn- ing objective based on a triplet architecture and Maximum Mean Discrepancy; as well as, (2) a novel deep architecture based on attentive recurrent neural networks. One benefit of our objective function is that it enforces a better separation within the learned embedding space of the different motion categories by means of the associated distribution moments. At the same time, our attentive recurrent neural network allows processing varying input sizes to a fixed size of embedding while learning to focus on those motion parts that are semantically distinctive. Our ex- periments on two different datasets demonstrate significant improvements over conventional human motion metrics.

研究の動機と目的

  • 従来の動き類似度メトリクス(L2 や DTW)が人間の動き系列における意味的・文脈的関係を捉えきれていないという限界を是正すること。
  • 明示的な系列アラインメントを必要とせず、意味的に類似した動きを埋め込み空間で近接させる深層メトリクス学習フレームワークを設計すること。
  • 注目拡張型再帰的アーキテクチャを用いて、変動長の動き系列からの有効な学習を可能にすること。
  • 分布ベースの損失監視によりハードネガティブマイニングの必要性を排除することで、計算コストを低減すること。
  • 行動検索や動きベースの人物識別といった下流タスクにおける性能向上を図ること。

提案手法

  • 最大平均差異(MMD)に基づく新規のMMD-NCA損失関数を導入し、分布モーメントの差を明確にすることで、動きのカテゴリ間の分離を促進し、ハードネガティブマイニングを回避する。
  • 注目メカニズムを備えた再帰的ニューラルネットワーク(RNN)を用い、意味的に特徴的なポーズパターンに注目することで、変動長の動き系列を処理し、固定長の埋め込みを生成する。
  • トリプルットベースのアーキテクチャを採用し、カーネル化されたMMD目的関数を用いて個々のサンプルではなく、全体の動き分布を比較する。
  • 訓練の安定化と特徴表現学習の向上のため、レイヤー正則化と自己注意メカニズムを適用する。
  • MMD-NCA損失における異なるカーネル関数(線形、多項式、RBF)を用い、高次統計モーメントが埋め込み品質に与える影響を調査する。
  • アーキテクチャのエンドツーエンド学習を、アーキテクチャのトリプルット(アーキテクチャ、ポジティブ(同クラス)、ネガティブ(異なるクラス))を用いた対照学習によって実施する。

実験結果

リサーチクエスチョン

  • RQ1分布レベルの監視に基づく深層メトリクス学習アプローチは、L2 や DTW といった従来の動き類似度メトリクスを上回り、意味的関係を的確に捉えることができるか?
  • RQ2注目拡張型RNNアーキテクチャは、変動長の人間の動き系列から固定長の埋め込みを学習するのにどの程度有効か?
  • RQ3MMDベースの損失によりハードネガティブマイニングを排除することで、動き類似度タスクにおける訓練効率と性能が向上するか?
  • RQ4MMD-NCA損失におけるカーネル関数の選択が、学習された動き埋め込みの品質にどの程度影響を与えるか?
  • RQ5提案手法は、行動検索および動きベースの人物識別において最先端の性能を達成できるか?

主な発見

  • 注目RNNを備えた提案MMD-NCA損失は、CMU MocapデータセットにおいてDTW、MDDTW、CTW、GDTWと比較して、誤検出率(FPR)を20%まで低減した。
  • CMU Mocapデータセットにおいて、最先端の深層学習ベースラインと比較してFPR-70で2%の改善を示し、優れた人物識別精度を実証した。
  • 自己注意メカニズムを削除すると最大の性能低下が生じ、NMIおよびF1スコアが顕著に低下した。これは、特徴的な動き部分を捕捉する上でそのメカニズムが極めて重要であることを示している。
  • レイヤー正則化と自己注意メカニズムは、それぞれFPRに約7%および10%の向上をもたらした。これは、モデルの安定性と表現品質の向上において両者とも重要であることを示している。
  • MMD-NCA損失における多項式カーネルおよびRBFカーネルは線形カーネルよりも優れた結果を示し、動き分布の高次モーメントが埋め込み品質を向上させることを示唆している。
  • 注目可視化により、モデルがボールを投げる動作(バスケットボール)や歩行時の曲げ動作(ガイト)といった意味的に特徴的な動きフェーズに的確に注目していることが確認された。一方、情報量の少ないフレームには無視していることも明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。