[論文レビュー] Mining YouTube - A dataset for learning fine-grained action concepts from webly supervised video data
本稿では、YouTubeの字幕を用いた弱教師付き監視によって自動的に動画をマイニングすることで、人間によるアノテーションを排除し、細分化された行動認識のための大規模なウェブスパイド監視データセットを紹介する。ノイズの多いデータにおけるクラスの曖昧さに対処するため、意味的階層構造を提案し、階層的推論が20万サンプルのデータセットにおいて、IoUで3.5%以上、IoDで12%向上させることを示している。
Action recognition is so far mainly focusing on the problem of classification of hand selected preclipped actions and reaching impressive results in this field. But with the performance even ceiling on current datasets, it also appears that the next steps in the field will have to go beyond this fully supervised classification. One way to overcome those problems is to move towards less restricted scenarios. In this context we present a large-scale real-world dataset designed to evaluate learning techniques for human action recognition beyond hand-crafted datasets. To this end we put the process of collecting data on its feet again and start with the annotation of a test set of 250 cooking videos. The training data is then gathered by searching for the respective annotated classes within the subtitles of freely available videos. The uniqueness of the dataset is attributed to the fact that the whole process of collecting the data and training does not involve any human intervention. To address the problem of semantic inconsistencies that arise with this kind of training data, we further propose a semantical hierarchical structure for the mined classes.
研究の動機と目的
- 完全教師あり行動認識データセットの限界に対処すること。これらのデータセットは作成に費用がかかり、現実世界の応用にスケーラブルではない。
- 人間によるクリップや時間的境界のアノテーションなしに、自動的かつ大規模にデータ収集することを可能にすること。
- 細分化された行動クラス間の意味的関係をモデル化することで、ウェブマイニングされたデータにおけるノイズと曇りを軽減すること。
- 弱教師あり、現実世界の動画データにおける階層的推論の有効性を評価すること。
提案手法
- まず、250本の調理動画を512の細分化された行動クラスで手動アノテートし、合計10,412件のサンプルを取得する。
- 学習データは、クラス名をキーワードにYouTubeの字下を検索することで自動的にマイニングされ、21,056本の動画から約20万件のクリップが得られた。
- 512の行動クラスの上に意味的階層木を構築し、一般の行動(例:'chop it')を内部ノードとし、具体的な行動(例:'chop tomato')を葉ノードとする。
- コンSENSUS確率を用いた階層的推論を実施する。上向き(親の応答が子の応答に基づく)と下向き(子の応答が親の応答に基づく)の両方を実行し、融合することで耐性を向上させる。
- マイニングされたデータで訓練された深層学習モデル(例:MLP)を用い、固定された250本の動画テストセットで評価する。
- 時間的行動局在の評価指標としてIoUとIoDを用い、データスケールおよび推論戦略に関するアブレーションスタディを実施する。
実験結果
リサーチクエスチョン
- RQ1YouTubeの字下から得た弱教師あり、ウェブマイニングされた動画データは、細分化された行動認識モデルの学習に有効に利用できるか?
- RQ2行動クラスに意味的階層を組み込むことで、ノイズが多く曇った学習データ下で性能にどのような影響を与えるか?
- RQ3高ノイズレベルにかかわらず、ウェブマイニングされた学習データのスケールを拡大することで認識性能が向上するか?
- RQ4上向き、下向き、および統合された異なる階層的推論戦略の間で、局在精度にどのような差が生じるか?
主な発見
- ノイズが多く曇った20万件のウェブマイニングデータで学習しても、10万件のデータと比較して平均IoUが2%以上向上しており、ノイズが存在してもスケールの恩恵が得られることを示している。
- 上向きと下向きのコンセンサスを統合した階層的推論戦略は、標準的な推論と比較してIoUを3.5%、IoDを12%向上させ、顕著な耐性の向上を示している。
- 上向きと下向きの両方を統合した推論が最良の性能を達成しており、複数レベルの整合性がノイズの多い環境下での局在精度向上に寄与していることが示された。
- 意味的階層構造は、同義語や多義語などの意味的不一致の影響を効果的に軽減し、モデルの汎化性能を向上させた。
- 人間によるアノテート済みクリップなしに、現実世界の未加工な動画データで学習が可能であることを示しており、スケーラブルな行動学習の実現可能性を示している。
- 最先端の特徴量やアーキテクチャですら、このデータセットでは困難を示しており、現実世界の弱教師あり行動認識の挑戦性が浮き彫りになっている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。