Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Kernel Distillation for Efficient Pose Estimation in Videos

Xuecheng Nie, Yuncheng Li|arXiv (Cornell University)|Aug 24, 2019
Human Pose and Action Recognition参考文献 31被引用数 10
ひとこと要約

本稿では、軽量なディスティルレーターを用いて、前のフレームからのポーズ知識をオンラインでディスティルすることで、小さなネットワークを用いた効率的な動画ベースの人体ポーズ推定を可能にする、ダイナミックカーネルディスティル(DKD)を提案する。ポーズカーネルと現在の特徴量との間の畳み込みマッチング手順に置き換えることで関節位置特定を単純化することにより、DKDは先行研究の最先端モデルと比較して10倍のFLOPs削減と2倍の高速化を達成しながら、Penn ActionおよびSub-JHMDBベンチマークで精度を維持または向上させた。

ABSTRACT

Existing video-based human pose estimation methods extensively apply large networks onto every frame in the video to localize body joints, which suffer high computational cost and hardly meet the low-latency requirement in realistic applications. To address this issue, we propose a novel Dynamic Kernel Distillation (DKD) model to facilitate small networks for estimating human poses in videos, thus significantly lifting the efficiency. In particular, DKD introduces a light-weight distillator to online distill pose kernels via leveraging temporal cues from the previous frame in a one-shot feed-forward manner. Then, DKD simplifies body joint localization into a matching procedure between the pose kernels and the current frame, which can be efficiently computed via simple convolution. In this way, DKD fast transfers pose knowledge from one frame to provide compact guidance for body joint localization in the following frame, which enables utilization of small networks in video-based pose estimation. To facilitate the training process, DKD exploits a temporally adversarial training strategy that introduces a temporal discriminator to help generate temporally coherent pose kernels and pose estimation results within a long range. Experiments on Penn Action and Sub-JHMDB benchmarks demonstrate outperforming efficiency of DKD, specifically, 10x flops reduction and 2x speedup over previous best model, and its state-of-the-art accuracy.

研究の動機と目的

  • 動画ベースの人体ポーズ推定における大規模ネットワークの高い計算コスト、特に低レイテンシ制約下での課題に対処すること。
  • 動画フレーム間の時間的整合性を活用することで、小さなネットワークが高精度なポーズ推定を達成できることを実現すること。
  • 時間的モデリングに3D畳み込み、オプティカルフロー、RNNなどの高コストなコンponentsに依存することを減らすこと。
  • 1フレームから次のフレームへポーズ知識を効率的に転送できる1回限りのフォワードディスティルメカニズムを開発すること。
  • 推論時に追加コストを加えずに、時間的整合性を保証するための時間的対抗的トレーニング戦略を確保すること。

提案手法

  • 軽量なCNNベースのディスティルレーターが、1回のフォワードパスで前フレームの特徴量とポーズ予測からポーズカーネルを推定する。
  • ポーズカーネルはボディ関節の配置パターンを符号化し、その後続フレームの推定に向けたコンactで再利用可能なガイドラインとして機能する。
  • 関節位置特定は、小さなネットワークからの特徴マップとポーズカーネルとの間の2次元畳み込みによる空間的マッチング手順に再定式化される。
  • トレーニング中に連続するフレーム間での妥当で一貫性のあるポーズ変化を強制するために、時間的対抗的ディスクライマが導入される。
  • 対抗的トレーニングにより、信頼度マップの時間的変動が制約され、推論時に追加計算を加えずに一貫性が向上する。
  • 全フレームがエンドツーエンドで学習可能であり、ディスクライマはテスト時に削除されるため、最小限の推論コストでデプロイ可能である。

実験結果

リサーチクエスチョン

  • RQ1軽量なディスティルメカニズムは、動画ベースのポーズ推定において1フレームから次のフレームへポーズ知識を転送できるか?
  • RQ2ポーズカーネルと特徴量の間の畳み込みマッチング操作に置き換えることで、関節位置特定を単純化しても高精度を維持しながら計算コストを削減できるか?
  • RQ3時間的対抗的トレーニング戦略は、フレーム間で妥当なポーズ進化を強制するためにどの程度効果的か?
  • RQ4動的にディスティルされたポーズカーネルによってガイドされた小さなネットワークが、どの程度最先端の精度に到達できるか?
  • RQ5提案手法は、限られた学習データを持つ小規模なデータセットに対しても十分に一般化できるか?

主な発見

  • Sub-JHMDBでは、人間サイズで正規化された指標で94.0%のPCKを達成し、前回のSOTAモデルを3.8ポイント上回った。
  • ResNet50をバックボーンとして用いた場合、DKDはFLOPsを10倍削減し、前回最良のモデルと比較して2倍の推論速度向上を達成した。
  • DKD(ResNet18)は、前回のSOTAモデルと同等の精度を達成しながら、4倍の高速化を実現し、強力な効率性向上を示した。
  • Penn Actionでは、92.4%のPCKを維持しながら、FLOPsを70.98Gから9.96Gにまで削減した。
  • 定量的結果では、動きのぼやけ、隠蔽、視点の変化、スケール変化に対しても、モデルのロバスト性が確認された。
  • 時間的対抗的トレーニングにより、推論コストを追加せずにフレーム間のポーズの一貫性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。