Skip to main content
QUICK REVIEW

[論文レビュー] Zero-Shot Learning with Common Sense Knowledge Graphs

Nihal V. Nayak, Stephen H. Bach|arXiv (Cornell University)|Jun 18, 2020
Domain Adaptation and Few-Shot Learning参考文献 112被引用数 12
ひとこと要約

本論文は、トランスフォーマーに基づくグラフ畳み込みネットワーク(TrGCN)を用いて、ゼロショット学習のための表現的で非線形なクラス表現を生成するために、常識的知識グラフを活用する新しいフレームワークZSL-KGを提案する。この手法は、視覚および言語タスクの6つのベンチマークのうち5つで、従来のWordNetベースのアプローチを上回り、OntoNotes、BBN、aPY、SNIPS-NLU、ImageNet 22Kで最先端の結果を達成した。

ABSTRACT

Zero-shot learning relies on semantic class representations such as hand-engineered attributes or learned embeddings to predict classes without any labeled examples. We propose to learn class representations by embedding nodes from common sense knowledge graphs in a vector space. Common sense knowledge graphs are an untapped source of explicit high-level knowledge that requires little human effort to apply to a range of tasks. To capture the knowledge in the graph, we introduce ZSL-KG, a general-purpose framework with a novel transformer graph convolutional network (TrGCN) for generating class representations. Our proposed TrGCN architecture computes non-linear combinations of node neighbourhoods. Our results show that ZSL-KG improves over existing WordNet-based methods on five out of six zero-shot benchmark datasets in language and vision.

研究の動機と目的

  • 既存のゼロショット学習手法が手作業で設計された属性やWordNetベースの埋め込みに依存するという限界(人的労力がかかる、ドメイン特化的である)を是正すること。
  • ゼロショット学習のための高レベルで汎用的な意味的知識としての、未だ活用が十分に行われていない常識的知識グラフの潜在的価値を調査すること。
  • 訓練中に全グラフ構造を必要としない、大規模で非有向の知識グラフから表現的なクラス表現を生成できる、帰納的で汎用的なフレームワークの開発。
  • オブジェクト分類にとどまらない、グラフニューラルネットワークベースのゼロショット学習フレームワークを、自然言語理解タスクへと拡張すること。
  • トランスフォーマー集約器を用いて、ノード近傍の非線形的かつ置換不変な組み合わせを学習することで、多様なベンチマークにおけるゼロショット性能の向上。

提案手法

  • 常識的知識グラフからのノードをベクトル空間に埋め込むことで、ゼロショット学習のためのクラス表現を生成する汎用的フレームワークZSL-KGを提案する。
  • ノード近傍特徴の非線形的かつ置換不変な組み合わせを計算する、新しいトランスフォーマーに基づくグラフ畳み込みネットワーク(TrGCN)を導入し、表現の表現力の向上を図る。
  • TrGCNで自己注意機構を採用し、隣接ノード特徴の重みを動的に割り当てることで、単純な平均や最大プーリングを超えた適応的集約を可能にする。
  • 帰納的設計を採用し、学習時に存在しなかった未観測のグラフやテストクラスに対しても推論が可能であり、一般化ゼロショット学習にとって不可欠である。
  • 関係性集約部におけるパラメータ数の削減と過学習の回避を目的として、低ランク因子分解と基底分解を活用する。
  • 言語タスクにはタスク固有のbiLSTMエンコーダと注意機構を適用し、視覚タスクにはResNetバックボーンを微調整し、それらをグラフベースのクラス表現と統合する。

実験結果

リサーチクエスチョン

  • RQ1常識的知識グラフは、多様なタスクにわたるゼロショット学習において、WordNetよりも汎用的で柔軟な意味的知識のソースとして機能する可能性を有するか?
  • RQ2トランスフォーマーに基づくグラフ畳み込みネットワーク(TrGCN)は、グラフニューラルネットワークにおける線形集約器と比較して、クラス表現学習を顕著に改善するか?
  • RQ3オブジェクト認識を目的としたグラフベースのゼロショット学習フレームワークを、自然言語理解タスクに効果的に適応できるか?
  • RQ4ZSL-KGは、視覚および言語のゼロショットベンチマークにおいて、最先端のWordNetベースの手法と比較して、どのように性能を発揮するか?
  • RQ5ZSL-KGの帰納的性質は、未学習のクラスやグラフに対しても、どれほど強固な一般化を可能にするか?

主な発見

  • ZSL-KGは、ゼロショット言語理解タスクにおいて、OntoNotes、BBN、aPY、SNIPS-NLUの各データセットで、新たな最先端性能を達成した。
  • ImageNet 22Kデータセットにおいても、既存のWordNetベースの手法を上回り、大規模な視覚ベンチマークへの強い一般化能力を示した。
  • AWA2データセットでは、ZSL-KGは競争力ある性能を維持し、さまざまなゼロショット学習設定における堅牢性を確認した。
  • アブレーションスタディの結果、自己注意を備えたTrGCNモジュールは、線形集約器(例:平均、最大)やGCN、GAT、RGCNなどの他のGNNバージョンと比較して顕著に性能向上を示した。
  • 常識的知識グラフの活用により、特に微細な意味的理解を要するタスクにおいて、より表現的で判別力のあるクラス表現が得られた。
  • ZSL-KGの帰納的性質により、テストクラスが学習グラフに含まれていなくても、効果的なゼロショット一般化が可能であり、スケーラビリティと適応性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。