[論文レビュー] Answering Visual-Relational Queries in Web-Extracted Knowledge Graphs
本稿では、14,870のエンティティ、1,330の関係、829,931枚の画像を有するウェブ抽出型の視覚的関係知識グラフ「ImageGraph」を紹介し、畳み込みニューラルネットワークと知識グラフ埋め込みを組み合わせた新しいニューラルアーキテクチャを提案する。本研究の主な貢献は、画像を知識グラフ内の第一級エンティティとして扱うことで、複雑な視覚的関係クエリに正確かつ効率的に応答する統合モデルを実現し、未学習の画像のグラウディングにおいて優れた性能を達成することである。
A visual-relational knowledge graph (KG) is a multi-relational graph whose entities are associated with images. We explore novel machine learning approaches for answering visual-relational queries in web-extracted knowledge graphs. To this end, we have created ImageGraph, a KG with 1,330 relation types, 14,870 entities, and 829,931 images crawled from the web. With visual-relational KGs such as ImageGraph one can introduce novel probabilistic query types in which images are treated as first-class citizens. Both the prediction of relations between unseen images as well as multi-relational image retrieval can be expressed with specific families of visual-relational queries. We introduce novel combinations of convolutional networks and knowledge graph embedding methods to answer such queries. We also explore a zero-shot learning scenario where an image of an entirely new entity is linked with multiple relations to entities of an existing KG. The resulting multi-relational grounding of unseen entity images into a knowledge graph serves as a semantic entity representation. We conduct experiments to demonstrate that the proposed methods can answer these visual-relational queries efficiently and accurately.
研究の動機と目的
- エンティティに画像が関連付けられ、視覚データを跨いで関係が学習される視覚的関係知識グラフに関する研究の不足に対処すること。
- 画像を知識グラフ内での第一級の存在として扱う、例えばマルチリレーション画像検索や視覚的リンク予測といった新しいクエリタイプを可能にすること。
- 確率的視覚的関係推論を実現するため、畳み込みニューラルネットワークと知識グラフ埋め込み手法を統合した統合的な深層学習フレームワークを開発すること。
- 推論時に視覚的特徴のみを用いて、未学習のエンティティの画像を既存の知識グラフに視覚的類似性と関係構造を基にグラウディングすることで、ゼロショット学習を検討すること。
- 提案モデルの有効性を、ドメイン内およびゼロショットの視覚的関係クエリ応答タスクの両方で評価すること。
提案手法
- 1,330種類の関係タイプ、14,870のエンティティ、ウェブから抽出した829,931枚の画像を有する大規模なウェブ抽出型視覚的関係知識グラフ「ImageGraph」を構築した。
- 事前学習済みのCNNからの画像埋め込みと知識グラフ埋め込みベクトルを、連結(CAT)や要素ごとの乗算といった演算を用いて統合する統合ニューラルアーキテクチャを提案した。
- 学習された演算を用いて画像埋め込みと関係固有のベクトルを合成するスコアリング関数を設計し、事前に計算された画像埋め込みを活用することで、クエリ時でのみスコアを計算する効率的なクエリ応答を可能にした。
- 不均衡な知識グラフの分布に対処するため、ネガティブサンプリングと最終層のシグモイド活性化関数を採用し、学習の安定性と性能を向上させた。
- ゼロショット学習を、推論時に視覚的特徴のみを用いて未学習の画像と既存の知識グラフエンティティ間の関係を予測する視覚的グラウディング問題として定式化した。
- 特に、ターゲットエンティティが既知のクエリタイプ(4)において、複数の画像サンプルの平均確率を用いることで、ゼロショット設定における関係ランク付けの耐性を高めた。
実験結果
リサーチクエスチョン
- RQ1視覚的関係知識グラフは、画像を知識グラフ内での第一級の存在として扱う確率的クエリの新種を可能にするか?
- RQ2統合CNN-KGEモデルは、ベースラインと比較して、マルチリレーション画像検索および視覚的リンク予測クエリをどの程度効果的に応答できるか?
- RQ3深層ニューラルネットワークは、未学習の画像と既存の知識グラフエンティティ間の関係をゼロショット設定で一般化して予測できるか?
- RQ4提案アーキテクチャは、エンティティおよび関係の分布が不均衡な視覚的関係クエリに対して、標準的なリンク予測ベースラインをどの程度上回るか?
- RQ5マルチリレーションリンクを通じて未学習の画像を知識グラフに視覚的グラウディングすることは、有効なゼロショット学習戦略となるか?
主な発見
- 画像埋め込みと関係埋め込みの連結に加え、シグモイド活性化関数を用いた出力層を備えたCAT-SIGモデルが、すべての指標で最良の性能を示し、中央順位とHits@100の両面でベースラインを上回った。
- 画像埋め込みを事前に計算することで、1回のマルチリレーション画像検索クエリをわずか90msで処理でき、613,138回の個別クエリを回避した。
- ゼロショット関係予測において、CATモデルはベースラインを著しく上回り、関係およびエンティティの分布の不均衡にもかかわらず、未学習エンティティへの一般化を示した。
- 2つの例題クエリのうち2つで正しい関係を上位3位以内にランク付けでき、2つの困難なケースのうち1つではトップ関係を正しく特定した。これにより、視覚的グラウディングにおける耐性が確認された。
- 結果から、マルチリレーションリンクを通じた視覚的グラウディングが、ゼロショット学習のための実用的で効果的なアプローチであることが確認された。これは、学習データなしで完全に新しい視覚的概念に対する推論を可能にする。
- 統合CNN-KGEモデルは良好に一般化され、表2に示すドメイン内関係予測と同等の性能を達成しており、強力なトランスファーラーニング能力を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。