Skip to main content
QUICK REVIEW

[論文レビュー] Weakly supervised learning of actions from transcripts

Hilde Kuehne, Alexander Richard|arXiv (Cornell University)|Oct 7, 2016
Human Pose and Action Recognition参考文献 23被引用数 5
ひとこと要約

本論文は、フレームレベルのアノテーションを一切使用せずに、動画のトランスクリプトとフレームレベル特徴量のみを用いて、反復的HMMベースの推論とモデル再推定を活用することで、行動モデルを学習する弱教師付き手法を提案する。この手法は、4つのベンチマークデータセットにおいて最先端の性能を達成し、アライメント性能で先行手法を2–5%上回り、セグメンテーションにおいて完全教師ありモデルに近づいた。

ABSTRACT

We present an approach for weakly supervised learning of human actions from video transcriptions. Our system is based on the idea that, given a sequence of input data and a transcript, i.e. a list of the order the actions occur in the video, it is possible to infer the actions within the video stream, and thus, learn the related action models without the need for any frame-based annotation. Starting from the transcript information at hand, we split the given data sequences uniformly based on the number of expected actions. We then learn action models for each class by maximizing the probability that the training video sequences are generated by the action models given the sequence order as defined by the transcripts. The learned model can be used to temporally segment an unseen video with or without transcript. We evaluate our approach on four distinct activity datasets, namely Hollywood Extended, MPII Cooking, Breakfast and CRIM13. We show that our system is able to align the scripted actions with the video data and that the learned models localize and classify actions competitively in comparison to models trained with full supervision, i.e. with frame level annotations, and that they outperform any current state-of-the-art approach for aligning transcripts with video data.

研究の動機と目的

  • 行動認識のためのフレームレベル動画アノテーションの高コストを解消するため、トランスクリプトレベルの順序情報のみを活用すること。
  • 手動による境界アノテーションを必要とせずに、動画における時間的行動セグメンテーションと分類を可能にすること。
  • 時間的セグメンテーションとモデル再推定を統合することで、反復的かつスケーラブルな学習フレームワークを構築し、行動モデルの精度を向上させること。
  • 弱教師付きで学習したモデルが、完全教師あり学習パイプラインの強力な初期化として機能できることを示すこと。
  • トランスクリプトからの弱教師付き情報のみを用いて、大規模データセットで競争力ある性能を達成すること。

提案手法

  • 各行動クラスを、トランスクリプトの順序に基づいて均等な時間的スプリットで初期化された隠れマルコフモデル(HMM)としてモデル化する。
  • 動画特徴量の観測確率を表現するためにガウス・ミックスチャネル(GMM)を用い、効率的なリアルタイムパラメータ更新を可能にする。
  • 反復的にシーケンスデコード(セグメンテーション推論)とモデル再推定を実行し、行動境界とHMMパラメータを精緻化する。
  • 収束性と過学習のバランスを考慮し、経験的評価に基づいて反復回数を3回に固定する。
  • 性能向上のため、GMMと深層畳み込みニューラルネットワーク(CNN)特徴量を組み合わせ、複雑な視覚的パターンをモデル化する。
  • 学習用トランスクリプトからの文法学習を活用し、入力トランスクリプトなしで未学習の動画のセグメンテーションを可能にする。

実験結果

リサーチクエスチョン

  • RQ1トランスクリプトレベルの順序情報とフレームレベル特徴量のみから、行動モデルを効果的に学習できるか?
  • RQ2フレームレベルアノテーションなしで、反復的推論とモデル再推定が時間的行動局所化を改善できるか?
  • RQ3提案手法は、アライメントおよびセグメンテーションタスクにおいて、最先端の弱教師付きアプローチと比較してどのように差をつけるか?
  • RQ4弱教師付きで学習したモデルが、完全教師ありモデルの初期化として有効に機能するか?
  • RQ5CNN特徴量の統合が、弱教師付き行動認識における性能向上に寄与するか?

主な発見

  • 提案手法は、Hollywood ExtendedデータセットでJaccard指数0.460を達成し、先行SOTA手法を2–5%上回るアライメント性能を示した。
  • Breakfastデータセットでは、GMM+CNNバージョンが平均オーバーラップ(MoF)0.282を達成し、ECTCベースラインを上回り、完全教師ありモデルに近づいた。
  • 本手法は、[3]と比較して学習時間を1桁短縮し、1データセットあたり0.47–5.1分で、3回の反復で学習を完了した。
  • Hollywood Extended、MPII Cooking、Breakfast、CRIM13といった多様なデータセットにおいて、100時間を超える動画データを含む、広範なデータセットで堅牢な性能を示した。
  • CNN特徴量の導入により、セグメンテーション性能が2.5%向上し、弱教師付き設定において深層視覚表現の有効性が裏付けられた。
  • 学習済みモデルは、学習データからの文法制約を活用することで、トランスクリプトなしでも未学習の動画の正確な時間的セグメンテーションを可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。