Skip to main content
QUICK REVIEW

[論文レビュー] Tracking Persons-of-Interest via Unsupervised Representation Adaptation

Shun Zhang, Jia‐Bin Huang|arXiv (Cornell University)|Oct 5, 2017
Face recognition and analysis参考文献 44被引用数 6
ひとこと要約

本稿では、空間的・時間的および文脈的制約を用いて事前学習済みCNNを微調整することで、制約のない動画におけるマルチフェイストラッキングのための教師なし表現適応手法を提案する。自己生成されたトレーニングサンプル上で対称的三重損失を最適化することで、外見の変動が著しいショット間でも顔再識別性能を向上させ、テレビコメディやYouTube音楽動画で最先端の性能を達成する。

ABSTRACT

Multi-face tracking in unconstrained videos is a challenging problem as faces of one person often appear drastically different in multiple shots due to significant variations in scale, pose, expression, illumination, and make-up. Existing multi-target tracking methods often use low-level features which are not sufficiently discriminative for identifying faces with such large appearance variations. In this paper, we tackle this problem by learning discriminative, video-specific face representations using convolutional neural networks (CNNs). Unlike existing CNN-based approaches which are only trained on large-scale face image datasets offline, we use the contextual constraints to generate a large number of training samples for a given video, and further adapt the pre-trained face CNN to specific videos using discovered training samples. Using these training samples, we optimize the embedding space so that the Euclidean distances correspond to a measure of semantic face similarity via minimizing a triplet loss function. With the learned discriminative features, we apply the hierarchical clustering algorithm to link tracklets across multiple shots to generate trajectories. We extensively evaluate the proposed algorithm on two sets of TV sitcoms and YouTube music videos, analyze the contribution of each component, and demonstrate significant performance improvement over existing techniques.

研究の動機と目的

  • テレビコメディや音楽動画などの制約のない動画におけるショット間で顕著な外見の変動が生じるマルチフェイストラッキングの課題に対処すること。
  • トレーニングデータとテストデータの分布の違いにより、事前学習済みCNN特徴量が機能しなくなるドメインシフト問題を克服すること。
  • 身に覚えのない顔のラベルなしに、動画固有の判別性の高い顔表現を学習する手法を開発すること。
  • 文脈的および空間的・時間的制約を活用して、ショット境界を越えた顔再識別およびトラジェクトリ連結を改善すること。
  • 複雑なショット遷移と外見の変化を伴う現実世界の動画データセットにおいて、本手法の有効性を示すこと。

提案手法

  • 空間的・時間的および文脈的制約を用いて、与えられた動画から正例および負例の顔ペアを含む多数のトレーニングサンプルを自動的に生成する。
  • 自己生成されたサンプル上で事前学習済み顔CNNを微調整し、動画固有の視覚的ドメインに適応させる。
  • ユークリッド距離が意味的顔類似度を反映するように埋め込み空間を最適化する対称的三重損失関数(SymTriplet)を提案する。
  • 適応された判別性の高い特徴量を用いて階層的クラスタリングを適用し、ショット間のトラックレットを連結して完全な軌道を形成する。
  • 主な登場人物がエピソードを跨いで一貫していることに着目し、1エピソードで適応された特徴量を他のエピソードに転送することで再トレーニング時間を短縮する。
  • シアンズ/三重損失ネットワークアーキテクチャを用いて、同一人物間の距離を最小化し、異なる人物間の距離を最大化することで、アイデンティティを保持する表現を学習する。

実験結果

リサーチクエスチョン

  • RQ1教師なし表現適応は、外見の変動が著しい制約のない動画における顔再識別を改善できるか?
  • RQ2文脈的および空間的・時間的制約から生成された自己学習データは、事前学習済みCNNを特定の動画に適応させるためにどれほど有効か?
  • RQ3提案された対称的三重損失関数は、標準的な三重損失よりも優れた判別性の高い特徴量学習をもたらすか?
  • RQ4本手法は、現実世界の動画データセットにおいて、最先端技術と比較してどれほどマルチフェイストラッキング性能を向上させるか?
  • RQ5適応された特徴量は、同じテレビシリーズのエピソード間で転送可能であり、性能を落とさずにトレーニングコストを削減できるか?

主な発見

  • 提案手法Ours-SymTriplet-Contxは、テレビコメディデータセットで66.7%のIDF1を達成し、先行研究の最先端手法を上回った。
  • YouTube音楽動画データセットでは、64.8%のMOTAおよび69.6%のMOTAを達成し、挑戦的で制約のないシーケンスにおいても優れた性能を示した。
  • アイデンティティスイッチ(IDS)と断片化(Frag)が顕著に低減され、コメディデータセットでは802 IDSおよび2018 Fragを記録し、ベースライン手法と比較して高い値を示した。
  • 1エピソード(BBT02)で適応された特徴量を用いた転移学習により、他のエピソードで66.3%のIDF1を達成し、適応された特徴量の優れた一般化性と再利用可能性を示した。
  • アブレーションスタディにより、文脈的制約の生成と対称的三重損失の両方が性能に不可欠であることが確認され、両方を除去するとIDF1が5%以上低下した。
  • 失敗事例は主に単一人物のショットで発生し、類似する外見の人物を区別するための負例が不十分であることが原因であり、マルチモーダルな監視の導入が今後の課題である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。