Skip to main content
QUICK REVIEW

[論文レビュー] Privileged Knowledge Distillation for Online Action Detection

Peisen Zhao, Lingxi Xie|arXiv (Cornell University)|Nov 18, 2020
Human Pose and Action Recognition参考文献 44被引用数 7
ひとこと要約

本稿では、トレーニング中に利用可能な未来の動画フレームを特権情報として活用する、オンラインアクション検出を目的とした新しい知識蒸留フレームワーク、Privileged Knowledge Distillation (PKD) を提案する。カリキュラム学習と補助ノードを用いて、完全な動画を入力とするオフライン教師モデルと、現在および過去のフレームしか入力としないオンライン生徒モデルとの間の入力データギャップを埋める。PKDは最先端の性能を達成し、TVSeriesで86.44%のmcAP、THUMOS14で64.45%のmAPを達成した。

ABSTRACT

Online Action Detection (OAD) in videos is proposed as a per-frame labeling task to address the real-time prediction tasks that can only obtain the previous and current video frames. This paper presents a novel learning-with-privileged based framework for online action detection where the future frames only observable at the training stages are considered as a form of privileged information. Knowledge distillation is employed to transfer the privileged information from the offline teacher to the online student. We note that this setting is different from conventional KD because the difference between the teacher and student models mostly lies in input data rather than the network architecture. We propose Privileged Knowledge Distillation (PKD) which (i) schedules a curriculum learning procedure and (ii) inserts auxiliary nodes to the student model, both for shrinking the information gap and improving learning performance. Compared to other OAD methods that explicitly predict future frames, our approach avoids learning unpredictable unnecessary yet inconsistent visual contents and achieves state-of-the-art accuracy on two popular OAD benchmarks, TVSeries and THUMOS14.

研究の動機と目的

  • 推論時におけるリアルタイムなオンラインアクション検出の課題に対処すること。ここで、推論時には現在および過去のフレームしか利用できない。
  • トレーニング時に利用可能な未来のフレームを特権情報として活用し、オンラインモデルの性能を向上させること。
  • 教師(完全な動画)と生徒(部分的入力)の間の入力差異に特化した知識蒸留フレームワークを設計することで、ネットワークアーキテクチャの差異とは異なる点を補うこと。
  • 補助ノードとカリキュラム学習を用いて、教師と生徒モデル間の情報ギャップを低減し、早期アクション検出の性能を向上させること。

提案手法

  • 完全な動画シーケンスを用いてトレーニングされたオフライン教師モデルが、現在および過去のフレームしか観測しないオンライン生徒モデルをガイドする知識蒸留フレームワークを導入する。
  • カリキュラム学習を適用し、短い未来フレームから長い未来フレームへと段階的に増加するシーケンスを用いて、生徒モデルを訓練する。この際、教師モデルは徐々に長い未来フレームを観測するようにする。
  • 生徒ネットワークの各層に補助ノードを挿入し、特定の特徴表現を正則化することで、アーキテクチャが同一でない場合でも教師の出力とより良い一致を実現する。
  • 知識蒸留を用いて、教師から生徒へと高レベルの意味的知識を転送し、明示的な未来フレーム予測なしに、生徒が未来のアクション意味を事前に予測できるように間接的にガイドする。
  • ソフトラベルの知識転送に基づく蒸留損失を定式化し、生徒が教師のアクション分類確率を再現できるように学習させる。
  • 教師からの蒸留損失と真値ラベルに対するクロスエントロピー損失の両方を組み合わせ、カリキュラムスケジューリングを用いて訓練を安定化させる。

実験結果

リサーチクエスチョン

  • RQ1トレーニング時に利用可能な未来の動画フレームを、オンラインアクション検出の性能向上に有効に特権情報として活用できるか?
  • RQ2主な差異がネットワークアーキテクチャではなく入力データにある場合に、知識蒸留をどのように変更して教師と生徒モデルのギャップを埋められるか?
  • RQ3カリキュラム学習により、生徒に徐々に複雑な特権情報が露出することで、オンラインアクション検出における蒸留プロセスが改善されるか?
  • RQ4生徒ネットワーク内の補助ノードは、情報ギャップを低減し、教師との特徴一致を向上させることができるか?
  • RQ5本手法は、明示的な未来フレーム予測アプローチ(例:TRN や F2G)と比較して、精度と効率の両面でオンラインアクション検出において優れた性能を示すか?

主な発見

  • 提案されたPKDフレームワークは、TVSeriesベンチマークで86.44%のmcAP、THUMOS14ベンチマークで64.45%のmAPを達成し、最先端の性能を実現した。
  • TRN や F2G などの明示的な未来フレーム予測を用いた手法と比較して、THUMOS14で1.7パーセンテージポイント以上優れた性能を示した。
  • すべてのアクション段階で優れた性能を発揮し、アクションの60%~70%の位置で最高のmcAP 89.0%を記録した。これは、優れた早期検出能力を示している。
  • 定性的な結果から、PKDはTVSeriesで「Fall」、「Answer phone」、「Drive car」などの以前に見逃されていたアクションインスタンスを検出できており、検出のロバスト性が向上していることが示された。
  • アブレーションスタディの結果、カリキュラム学習と補助ノードの両方が性能向上に顕著に寄与しており、併用することで最も良い結果が得られた。
  • 「Hammer Throw」アクションシーケンスにおいて、本手法は時間経過に伴い一貫した予測を示した一方で、ベースラインモデルはより不規則な出力を示しており、安定性と正確性の両面で優位性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。