Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Domain Adaptation for Animal Pose Estimation

Jinkun Cao, Hongyang Tang|arXiv (Cornell University)|Aug 16, 2019
Human Pose and Action Recognition参考文献 55被引用数 8
ひとこと要約

本論文は、限られたラベル付きの動物のデータを活用し、人間のポーズデータセットを事前知識として用いることで、動物のポーズ推定のためのクロスドメイン適応フレームワークを提案する。弱い教師ありおよび半教師ありのドメイン適応(WS-CDA)と段階的擬似ラベル最適化(PPLO)を組み合わせることで、これらのクラスにポーズラベルが一切ない状態でも、未観測の動物種に対して53.1 mAPを達成し、人間レベルの精度に近づいた。

ABSTRACT

In this paper, we are interested in pose estimation of animals. Animals usually exhibit a wide range of variations on poses and there is no available animal pose dataset for training and testing. To address this problem, we build an animal pose dataset to facilitate training and evaluation. Considering the heavy labor needed to label dataset and it is impossible to label data for all concerned animal species, we, therefore, proposed a novel cross-domain adaptation method to transform the animal pose knowledge from labeled animal classes to unlabeled animal classes. We use the modest animal pose dataset to adapt learned knowledge to multiple animals species. Moreover, humans also share skeleton similarities with some animals (especially four-footed mammals). Therefore, the easily available human pose dataset, which is of a much larger scale than our labeled animal dataset, provides important prior knowledge to boost up the performance on animal pose estimation. Experiments show that our proposed method leverages these pieces of prior knowledge well and achieves convincing results on animal pose estimation.

研究の動機と目的

  • 訓練および評価のための規模が大きく、正確にアノテートされた動物のポーズデータセットが不足している問題に対処する。
  • 人間と動物のポーズ推定の間のドメインシフトを克服し、人間のポーズデータから知識を転送する。
  • 最小限のラベル付きデータを用いて、未観測の動物種におけるポーズ推定のパフォーマンスを向上させる。
  • 人間のポーズ事前知識と限られた動物のポーズアノテーションを融合する、堅牢な適応メカニズムを開発する。
  • 自己教師付きの擬似ラベル化を通じて、動物のポーズ推定におけるクロス種の一般化を有効に実現する。

提案手法

  • 弱い教師ありおよび半教師ありのクロスドメイン適応(WS-CDA)フレームワークを提案し、特徴抽出器、ドメイン識別器、キーポイント推定器を敵対的に訓練する。
  • 事前学習済みの人間のポーズモデルを初期化として用い、少量のラベル付き動物ポーズデータを用いてファインチューニングする。
  • 高信頼度の予測を擬似ラベルとして選択する段階的擬似ラベルベース最適化(PPLO)戦略を導入する。
  • 信頼度の低い予測からのノイズを低減するため、信頼性の高い擬似ラベルを優先する自己スケーリング学習メカニズムを適用する。
  • キーポイント推定器とドメイン識別器の間で交互に訓練することで最適化を安定化させ、ドメイン整合性を向上させる。
  • 新しい動物ポーズデータセットのアノテーション形式を、一般的な人間のポーズデータセット(例:COCO)に合わせることで、人間の事前知識の統合を容易にする。

実験結果

リサーチクエスチョン

  • RQ1大規模な人間のポーズデータセットからの知識が、未観測の種における動物のポーズ推定を効果的に改善できるか?
  • RQ2限られたラベル付き動物データを用いて、人間と動物のポーズの間のドメインシフトをどのように軽減できるか?
  • RQ3高信頼度の予測からの擬似ラベル化が、真のアノテーションが一切ない未観測の動物クラスにおけるモデルの一般化を向上させられるか?
  • RQ4敵対的ドメイン適応と段階的擬似ラベル化の組み合わせが、標準的なドメイン適応ベースラインを上回るか?
  • RQ5元のポーズアノテーションが歪められる場合に、GANベースのデータ拡張が動物のポーズ推定に与える影響は何か?

主な発見

  • 提案された WS-CDA+PPLO 法は、未観測の動物種(例:馬、牛、ヤギ)に対して、ポーズラベルが一切ない状態でも53.1 mAPを達成した。
  • 5つのラベル付き動物クラスを含むテストセットでは、少量のラベル付き動物データのみを用いて65.7 mAPを達成した。
  • 人間データで事前学習し、動物データでのファインチューニングのみを実施したモデルは性能が低く、人間特有の特徴バイアスを避けるためにドメイン適応が必要であることが示された。
  • CycleGAN を用いた GAN ベースのデータ拡張は、歪んだポーズラベルにより性能を低下させ、元のアノテーションが無効化された。
  • 提案手法は、CycleGAN+PL やドメイン混乱、リサイクル転送といった強力なベースラインを上回り、特に未観測種において顕著な優位性を示した。
  • アブレーションスタディにより、WS-CDA と PPLO の両方が不可欠であることが確認され、完全なパイプラインはアブレーション変種を著しく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。