Skip to main content
QUICK REVIEW

[論文レビュー] Learning Graph Embeddings for Open World Compositional Zero-Shot Learning

Massimiliano Mancini, Muhammad Ferjad Naeem|arXiv (Cornell University)|May 3, 2021
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、可視的プリミティブ(物体および状態)とその構成の間の依存関係を、妥当性に配慮したエッジ重みを備えた重み付きグラフを用いてモデル化する、構成的コサイングラフ埋め込み(Co-CGE)という、グラフニューラルネットワークの手法を提案する。学習済みの妥当性スコアをコサイン類似度損失のマージンおよび隣接行列の重みとして統合することで、標準的およびオープンワールドの構成的ゼロショット学習の両設定で最先端の性能を達成し、合成空間が著しく拡大されたより現実的なオープンワールド設定において、先行手法を著しく上回る。

ABSTRACT

Compositional Zero-Shot learning (CZSL) aims to recognize unseen compositions of state and object visual primitives seen during training. A problem with standard CZSL is the assumption of knowing which unseen compositions will be available at test time. In this work, we overcome this assumption operating on the open world setting, where no limit is imposed on the compositional space at test time, and the search space contains a large number of unseen compositions. To address this problem, we propose a new approach, Compositional Cosine Graph Embeddings (Co-CGE), based on two principles. First, Co-CGE models the dependency between states, objects and their compositions through a graph convolutional neural network. The graph propagates information from seen to unseen concepts, improving their representations. Second, since not all unseen compositions are equally feasible, and less feasible ones may damage the learned representations, Co-CGE estimates a feasibility score for each unseen composition, using the scores as margins in a cosine similarity-based loss and as weights in the adjacency matrix of the graphs. Experiments show that our approach achieves state-of-the-art performances in standard CZSL while outperforming previous methods in the open world scenario.

研究の動機と目的

  • テスト時の組み合わせが既知である閉世界を仮定する標準的構成的ゼロショット学習(CZSL)の限界を克服するため、すべての可能な組み合わせが出力空間に存在すると想定するより現実的なオープンワールド設定を提案すること。
  • 物体、状態、およびそれらの構成の間の依存関係を構造的なグラフニューラルネットワークでモデル化することで、未観測の組み合わせへの一般化を向上させること。
  • 「熟した犬」のような不適切または干渉的組み合わせ(例:「熟した犬」)が与える悪影響を軽減するため、それらの妥当性を推定し、表現学習をガイドすること。
  • 妥当性マージンを用いたコサインベースの損失により、視覚的および意味的埋め込み空間を統合し、より良い整合性と識別性を実現すること。
  • 提案手法が閉世界仮定を越えて効果的に一般化できることを示し、組み合わせ空間が約28,000にまで拡大しても強力な性能を発揮すること。

提案手法

  • Co-CGEは、物体、状態、およびそれらの構成を表すノードを接続するグラフ畳み込みネットワーク(GCN)を採用し、関連概念間でメッセージパッシングを実行することで表現学習を向上させる。
  • 未観測の組み合わせの妥当性スコアは、構成要素のプリミティブの視覚的および意味的埋め込み間のコサイン類似度に基づいて計算され、その組み合わせが意味的および視覚的にどれほど妥当であるかを反映する。
  • これらの妥当性スコアは、コサインベースの交差エントロピー損失のマージンとして使用され、不適切な組み合わせが正しいものから離れるようにモデルを促進する。
  • 同じ妥当性スコアがグラフの隣接行列の重みとして使用され、メッセージパッシング中に不適切またはノイズの多い組み合わせの影響を低減する。
  • モデルは、視覚特徴と構成的埋め込みを整列させる対照学習の目的関数を用いて訓練され、グローバルな一貫性を確保するためグラフ構造を活用する。
  • 本手法は、閉世界およびオープンワールドの推論を両方サポートし、オープンワールドバージョンでは、テスト時にどの組み合わせが出現するかを事前に知らないと仮定する。

実験結果

リサーチクエスチョン

  • RQ1グラフベースのモデルは、テスト時に全組み合わせ空間が未知である場合でも、すべての可能な物体-状態の組み合わせに一般化可能な構成的埋め込みを効果的に学習できるか?
  • RQ2視覚的および意味的埋め込みから導出される妥当性スコアは、不整合的または非現実的な組み合わせに対するモデルのロバスト性を向上させるためにどのように活用できるか?
  • RQ3妥当性スコアを損失のマージンおよびグラフの重みの両方として統合することで、単独で使用する場合よりも一般化性能が向上するか?
  • RQ4提案手法であるCo-CGEは、閉世界およびオープンワールドの構成的ゼロショット学習ベンチマークにおいて、既存の最先端手法と比較してどのように差をつけるか?
  • RQ5学習された構成的埋め込みは、既知および未知の組み合わせにおける信頼性の高い画像検索をどの程度サポートするか?

主な発見

  • Co-CGEは、標準的構成的ゼロショット学習ベンチマークで最先端の性能を達成し、CGE や CompCos などの先行手法を上回り、C-GQA では 0.78 AUC、MIT-States では 2.3 の精度を達成した。
  • オープンワールド設定では、先行手法を著しく上回り、複数のデータセットで未観測の組み合わせの調和平均精度が 11.9% に達し、次に良い手法(11.8%)を上回った。
  • コサインベース分類を用いたモデル(Co-CGE)は、非コサイン対応のバージョン(Co-CGE_ff)を常に上回り、コサイン類似度によるメトリクス学習が一般化性能を向上させることを示した。
  • Co-CGEは、既知の組み合わせと未観測の組み合わせの精度の間で強いトレードオフを示し、MIT-States では 16.0% の既知精度と 11.9% の未観測精度を達成し、調和平均が 12.4% であった。
  • 検索研究から、CZSL精度が高いモデルが必ずしも優れた構成的埋め込みを提供するわけではないことが判明した。Co-CGE および Co-CGE_CW は、既知および未観測の検索性能の両面で最良のバランスを達成した。
  • 妥当性スコアのメカニズムは、不適切な組み合わせの悪影響を効果的に低減しており、損失のマージンおよびグラフ重みの両方で使用した場合に性能が向上したことが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。