Skip to main content
QUICK REVIEW

[論文レビュー] Zero-Shot Learning with Knowledge Enhanced Visual Semantic Embeddings

Karan Sikka, Jihua Huang|arXiv (Cornell University)|Nov 21, 2020
Domain Adaptation and Few-Shot Learning参考文献 74被引用数 5
ひとこと要約

本稿では、共通理解に基づく神経記号的損失(CSNL)を提案する。CSNLは、視覚的・意味的埋め込みに共通理解の論理的ルール(例:上位概念関係や属性関係)を強制することで、ゼロショット学習(ZSL)の性能を向上させる、新しい神経記号的損失関数である。グループ単位でのルール強制と信頼度マージンを用いた暗黙的カリキュラム学習により、埋め込み空間の識別性が向上し、AWA2およびKinetics-ZSでそれぞれ11.5%および11.6%の向上を達成し、最先端の性能を実現した。

ABSTRACT

We improve zero-shot learning (ZSL) by incorporating common-sense knowledge in DNNs. We propose Common-Sense based Neuro-Symbolic Loss (CSNL) that formulates prior knowledge as novel neuro-symbolic loss functions that regularize visual-semantic embedding. CSNL forces visual features in the VSE to obey common-sense rules relating to hypernyms and attributes. We introduce two key novelties for improved learning: (1) enforcement of rules for a group instead of a single concept to take into account class-wise relationships, and (2) confidence margins inside logical operators that enable implicit curriculum learning and prevent premature overfitting. We evaluate the advantages of incorporating each knowledge source and show consistent gains over prior state-of-art methods in both conventional and generalized ZSL e.g. 11.5%, 5.5%, and 11.6% improvements on AWA2, CUB, and Kinetics respectively.

研究の動機と目的

  • 深層ニューラルネットワークの視覚的・意味的埋め込みに共通理解の知識を統合することで、ゼロショット学習(ZSL)の性能を向上させること。
  • 埋め込み空間におけるクラスレベルの区別が不十分であるため、視覚的・意味的埋め込み(VSE)モデルが未学習クラスに対して一般化性能に欠ける問題を解決すること。
  • 従来の手法がVSEの定式化に複雑な修正を加える必要があることや、階層的および属性ベースの関係を効果的に活用できないという限界を克服すること。
  • 信頼度マージンとグループ単位のルール強制を用いて暗黙的カリキュラム学習を可能にする神経記号的損失を開発し、より良い一般化性能を実現すること。
  • 上位概念および属性ベースのルールが、従来のZSLおよび一般化ZSLの両設定において、性能向上に寄与するかを評価すること。

提案手法

  • 人間が理解可能な論理的ルールを視覚的特徴上の微分可能な制約に変換する、新しい神経記号的損失関数である共通理解に基づく神経記号的損失(CSNL)を提案する。
  • 「isA(x, Tiger) → isA(x, Carnivore)」のような論理的ルールをVSE空間に強制し、視覚的特徴が共通理解の意味的階層と整合するようにする。
  • グループ単位でのルール強制を導入し、あるサンプルが上位概念クラス(例:「Feline」)に類似している場合、そのすべてのメンバークラス(例:「Tiger」、「Cat」)に対しても類似している必要がある。これにより構造的整合性が向上する。
  • 論理演算子内に信頼度マージンを組み込み、モデルの信頼度が高くなった段階でルールの強制を開始することで、暗黙的カリキュラム学習を実現し、早期過学習を低減する。
  • 従来のDeep Adaptive Semantic Logic(DASL)を拡張し、論理的ルールを微分可能な損失関数に変換する手法を提供し、標準的なVSE学習とエンドツーエンドで最適化可能にする。
  • 誘導的および転送的ZSL設定の両方をサポートし、転送的バージョンでは未ラベルのテストデータを活用して性能をさらに向上させる。

実験結果

リサーチクエスチョン

  • RQ1共通理解の知識を論理的ルールとして視覚的・意味的埋め込みに統合することで、ゼロショット学習における埋め込みの識別性能が向上するか?
  • RQ2上位概念セットのようなグループ単位でのルール強制は、個々の概念に対してルールを強制するのと比較して、より良い一般化性能をもたらすか?
  • RQ3論理演算子内に信頼度マージンを導入することで、暗黙的カリキュラム学習が可能になり、トレーニング中の過学習を防げるか?
  • RQ4CSNLは、最先端の手法と比較して、従来のZSLおよび一般化ZSLベンチマークでどれほど高い性能を発揮するか?
  • RQ5CSNLは、転送的設定で未ラベルのテストデータを効果的に活用し、性能をさらに向上させることができるか?

主な発見

  • AWA2データセットでは、CSNLがMCA_tで11.5%の絶対的向上を達成し、先行SOTA手法(Zhangら)の61.0%を上回る59.9%を記録した。
  • CUBデータセットでは、CSNLがMCA_tで32.5%を達成し、前回SOTAのSJEよりも13.8%向上し、ベースラインのDevise手法よりも10.8%向上した。
  • 一般化ZSL設定(HM指標)では、CSNL_tr(転送的バージョン)がAWA2で64.0%のHMを達成し、QFSL_tr(42.2%)やZhang(35.7%)を大きく上回り、クラス不均衡に対して強いロバストネスを示した。
  • Kinetics-ZSでは、CSNLが転送的設定でMCA_tが67.5%、HMが47.0%を達成し、先行SOTA(Zhangら)より11.6%向上し、ベースラインのDevise手法より15.6%向上した。
  • アブレーションスタディの結果、上位概念および属性ベースのルールの両方が性能向上に寄与しており、グループ単位のルール強制と信頼度マージン機構が過学習の低減と一般化性能の向上に不可欠であることが確認された。
  • CSNLの転送的バージョン(CSNL_tr)は、すべてのデータセットでベースラインを常に上回り、未ラベルのテストデータを効果的に活用して埋め込み空間を最適化できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。