Skip to main content
QUICK REVIEW

[論文レビュー] End-to-End Video Classification with Knowledge Graphs

Yuan Fang, Zhe Wang|arXiv (Cornell University)|Nov 6, 2017
Multimodal Machine Learning Applications参考文献 30被引用数 7
ひとこと要約

本稿では、外部の知識グラフを深層学習モデルと統合することで、マルチラベル動画分類を向上させるエンドツーエンドの知識認識型動画分類フレームワークを提案する。知識グラフと動画特徴学習を統合することで、YouTube-8Mにおいて最大2.9%の平均平均適合率(mAP)向上を達成し、外部の意味的知識がモデルの一般化性能を向上させることを示している。特に、長尾分布や曖昧なクラスにおいて顕著な効果を示す。

ABSTRACT

Video understanding has attracted much research attention especially since the recent availability of large-scale video benchmarks. In this paper, we address the problem of multi-label video classification. We first observe that there exists a significant knowledge gap between how machines and humans learn. That is, while current machine learning approaches including deep neural networks largely focus on the representations of the given data, humans often look beyond the data at hand and leverage external knowledge to make better decisions. Towards narrowing the gap, we propose to incorporate external knowledge graphs into video classification. In particular, we unify traditional "knowledgeless" machine learning models and knowledge graphs in a novel end-to-end framework. The framework is flexible to work with most existing video classification algorithms including state-of-the-art deep models. Finally, we conduct extensive experiments on the largest public video dataset YouTube-8M. The results are promising across the board, improving mean average precision by up to 2.9%.

研究の動機と目的

  • 人間と機械の動画理解における知識ギャップを埋めるために、外部の意味的知識を統合すること。
  • 従来の知識なしの深層学習モデルを、エンドツーエンドで学習可能なフレームワーク内で外部の知識グラフと統合すること。
  • YouTube-8Mのような大規模で長尾分布を示すデータセットにおけるマルチラベル動画分類性能の向上。
  • ケーススタディを通じて、知識グラフがいつ、なぜ分類性能を向上または低下させるかを調査すること。
  • 既存の動画分類モデル(SOTAの深層ネットワークを含む)との柔軟な統合を可能にすること。

提案手法

  • フレームワークは、統合埋め込み空間を通じて知識グラフと動画特徴表現を統合し、エンドツーエンド学習を可能にする。
  • 関係性の知識を知識グラフから符号化するために、グラフ畳み込みネットワーク(GCN)を用いる。これにより、動画レベルの表現が豊かになる。
  • 動画分類損失と知識認識型対照的損失を同時に最適化することで、動画特徴と知識グラフ内の意味的に関連する概念が一致するようにする。
  • DBoF やLSTMベースのアーキテクチャなどの既存の動画モデルを特徴抽出器として扱うことで、柔軟な統合を実現する。
  • 動画の意味的コンテンツをサポートする関連する知識グラフ経路に注目する学習を可能にし、一般化性能を向上させる。
  • 動画特徴とグラフ内の意味的に整合性のある概念が一致するように促す、知識認識型損失関数を採用する。

実験結果

リサーチクエスチョン

  • RQ1外部の知識グラフは、YouTube-8Mのような大規模で長尾分布を示すデータセットにおけるマルチラベル動画分類性能を向上させることができるか?
  • RQ2知識グラフの統合は、曖昧またはリソースが限られた動画カテゴリにおけるモデル性能にどのように影響するか?
  • RQ3どのような状況で知識グラフが予測を向上させ、また逆に性能を低下させるのか?
  • RQ4動画コンテンツと知識グラフの概念との間の意味的整合性は、分類精度にどのような役割を果たすか?
  • RQ5知識グラフをどのように効果的かつエンドツーエンドで深層学習モデルと統合できるか?

主な発見

  • 提案されたエンドツーエンドフレームワークは、YouTube-8Mベンチマークにおいて、SOTAの知識なしモデルと比較して最大2.9%の平均平均適合率(mAP)向上を達成した。
  • 知識グラフは、視覚的ヒントが不十分な長尾分布や曖昧なクラスにおいて、24.9%の動画の予測順位を顕著に向上させた。
  • 8.9%のケースでは、知識グラフの統合が予測を悪化させた。主な原因は、意味的に整合性はあるが関係のない概念からの過剰一般化であった。
  • ケーススタディでは、関連する概念(例:「折り紙」の文脈での「紙」「おもちゃ」)が存在し、正解ラベルと意味的に整合している場合に知識グラフが有効であることが示された。
  • 一部のネガティブケースが存在するが、全体としてのパフォーマンス向上が確認された。知識統合の総合的利点を裏付けた。
  • フレームワークは柔軟であり、DBoF やLSTMベースのアーキテクチャを含む、さまざまな既存の動画分類モデルと組み合わせ可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。