[論文レビュー] All About Knowledge Graphs for Actions
本稿では、語彙埋め込み、動詞+名詞ペア、視覚特徴という複数の知識表現を用いて、未学習の行動に一般化する能力を向上させる、知識グラフ(KG)ベースのフレームワークを提案する。ハイブリッドKGの構築とグラフ畳み込みネットワーク(GCN)の活用により、特に言語的および視覚的知識を統合した場合、ベースライン手法に比べてUCF101で最大15.8%のゼロショット精度向上を達成する。
Current action recognition systems require large amounts of training data for recognizing an action. Recent works have explored the paradigm of zero-shot and few-shot learning to learn classifiers for unseen categories or categories with few labels. Following similar paradigms in object recognition, these approaches utilize external sources of knowledge (eg. knowledge graphs from language domains). However, unlike objects, it is unclear what is the best knowledge representation for actions. In this paper, we intend to gain a better understanding of knowledge graphs (KGs) that can be utilized for zero-shot and few-shot action recognition. In particular, we study three different construction mechanisms for KGs: action embeddings, action-object embeddings, visual embeddings. We present extensive analysis of the impact of different KGs in different experimental setups. Finally, to enable a systematic study of zero-shot and few-shot approaches, we propose an improved evaluation paradigm based on UCF101, HMDB51, and Charades datasets for knowledge transfer from models trained on Kinetics.
研究の動機と目的
- 異なる知識グラフ(KG)構築手法がゼロショットおよびフェイントショット行動認識に与える影響を調査すること。
- 学習済みクラスから未学習クラスへの知識転送の有効性を、語彙ベース、動詞+目的語ベース、視覚特徴ベースのKGで評価すること。
- Kinetics(学習用)とUCF101、HMDB51、Charades(テスト用)の間で共通クラスを除外する新たな評価パラダイムを構築し、公平なゼロショットおよびフェイントショット学習ベンチマークを確保すること。
- 行動フレーズの系列モデリング(sentence2vecを用いて)が、単一語の埋め込みよりも優れた意味的表現をもたらし、行動認識に寄与することを示すこと。
提案手法
- 行動クラス名の語彙埋め込みを用いたKG1、行動フレーズからの動詞+名詞ペア埋め込みを用いたKG2、フェイントショット例からの視覚特徴埋め込みを用いたKG3という3つの異なる知識グラフを構築する。
- 複数語の行動フレーズをdenseな意味的ベクトルにエンコードするためにsentence2vecを用い、単一語の埋め込みよりも優れた表現を実現する。
- 各KGにグラフ畳み込みネットワーク(GCN)を構築し、学習済みクラスから未学習クラスへ分類器重みを伝搬する。
- 複数のKG(例:KG1 + KG2 + KG3)を組み合わせてハイブリッド知識グラフを構築し、フェイントショット学習における特徴転送を強化する。
- 情報伝搬とスムージングの観点から、グラフにおける最適な深さとして6層のGCNを採用する。
- Kinetics(学習用)とUCF101、HMDB51、Charades(テスト用)の間で共通クラスを除外する新しい評価プロトコルを設計し、有効なゼロショットおよびフェイントショットベンチマークを確保する。
実験結果
リサーチクエスチョン
- RQ1語彙埋め込み、動詞+名詞ペア、視覚特徴という異なる知識グラフ構築手法が、ゼロショットおよびフェイントショット行動認識性能に与える影響は何か?
- RQ2sentence2vecによる言語的意味表現と視覚的特徴の相対的寄与度は、未学習の行動への一般化能力向上にどの程度寄与するか?
- RQ3言語的および視覚的KGを組み合わせることで、単一のKGタイプよりも優れた性能が得られるか?
- RQ4グラフ畳み込みネットワーク(GCN)の深さが、行動認識における知識転送性能に与える影響は何か?
- RQ5GCNベースの知識転送は、近隣の分類器重みの単純な線形結合を上回るか?
主な発見
- 複数語の行動フレーズをsentence2vecでエンコードすることで、意味的表現が著しく向上し、単一語の埋め込みよりも優れたゼロショット認識性能が達成される。
- KG1(語彙ベース)、KG2(動詞+名詞ベース)、KG3(視覚特徴ベース)の3つのKGを統合したハイブリッドKGが最も高い性能を示し、ベースライン手法に比べUCF101で15.8%のゼロショット精度向上を達成する。
- 視覚的特徴が顕著に特徴づけられる行動(例:"uneven bars" や "shoot gun")に対しては、KG3(視覚特徴ベースのKG)が最も優れた性能を示す。
- 6層のGCNが最適な性能を達成する。これは、より深いネットワークでは過剰スムージングが生じ、浅いネットワークでは情報伝搬が制限されるためである。
- GCNベースのアプローチは、近隣分類器重みの単純な線形結合を上回り、グラフ内での構造的メッセージパッシングの価値を示している。
- 視覚的アテンションマップ(CAM)により、モデルが意味的な関係を学習していることが確認された。例えば、「playing sitar」は「playing guitar」と関連して活性化するが、「biking」のような関連のない行動とは関連しない。これは、モデルの一般化能力を裏付ける。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。