Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Zero-Shot Recognition based on Visually Semantic Embedding

Pengkai Zhu, Hanxiao Wang|arXiv (Cornell University)|Nov 19, 2018
Domain Adaptation and Few-Shot Learning参考文献 27被引用数 9
ひとこと要約

本稿は、学習済みの代表的部品タイプの低次元確率的混合として画像を表現することにより、視覚的・意味的ギャップを埋めるために視覚的意味的埋め込みを用いる、新しい一般化ゼロショット学習(GZSL)手法を提案する。この手法は、意味的および視覚的監視の両方において、ベンチマークデータセットで最先端の手法を上回る性能を示し、主な貢献として、意味的ノイズを低減し一般化性能を向上させる新しい視覚的オラクルを導入している。

ABSTRACT

We propose a novel Generalized Zero-Shot learning (GZSL) method that is agnostic to both unseen images and unseen semantic vectors during training. Prior works in this context propose to map high-dimensional visual features to the semantic domain, we believe contributes to the semantic gap. To bridge the gap, we propose a novel low-dimensional embedding of visual instances that is "visually semantic." Analogous to semantic data that quantifies the existence of an attribute in the presented instance, components of our visual embedding quantifies existence of a prototypical part-type in the presented instance. In parallel, as a thought experiment, we quantify the impact of noisy semantic data by utilizing a novel visual oracle to visually supervise a learner. These factors, namely semantic noise, visual-semantic gap and label noise lead us to propose a new graphical model for inference with pairwise interactions between label, semantic data, and inputs. We tabulate results on a number of benchmark datasets demonstrating significant improvement in accuracy over state-of-the-art under both semantic and visual supervision.

研究の動機と目的

  • 高次元の視覚的特徴が意味的解釈可能性に欠けるため、ゼロショット学習における視覚的・意味的ギャップを解消すること。
  • 視覚的オラクルを導入することで、ノイズの多い意味的データの影響を低減し、よりクリアな部品ベースの監視信号を提供すること。
  • 入力、ラベル、意味的データの間で相互作用を有する3ノードのグラフィカルモデルを構築し、推論性能を向上させること。
  • 従来の意味的監視と比較して、視覚的意味的埋め込みがGZSL設定で優れた性能を示すことを実証すること。
  • 複数のベンチマークデータセットにおいて、意味的および視覚的監視の両方の下で、提案手法の有効性を検証すること。

提案手法

  • 画像を、各成分が代表的部品タイプの存在確率を示す低次元確率行列として表現する視覚的意味的埋め込みを提案する。
  • 複数の注意メカニズムを用いて、トレーニングセット全体で有限個の部品タイプを学習し、分離可能で解釈可能な視覚的表現を可能にする。
  • 入力(X)、ラベル(Y)、意味的(S)変数の間でペアワイズ相互作用を持つ3ノードのグラフィカルモデルを導入し、標準的なチェーン構造(X→S→Y)とは異なる。
  • 視覚的特徴に基づいて、真の部品タイプの存在確率を提供する視覚的オラクルを設計し、ノイズの多い意味的属性よりもクリアな監視信号を提供する。
  • 部品固有の特徴と混合モデルを同時に学習する構造化学習フレームワークを採用し、部品の空間的・意味的整合性を保つ。
  • 意味的および視覚的監視の両方で性能を評価し、DEVISEなどの強力なベースラインと比較することで一般化性能を示す。

実験結果

リサーチクエスチョン

  • RQ1低次元で部品ベースの視覚的埋め込みは、ゼロショット学習における視覚的・意味的ギャップを効果的に低減できるか?
  • RQ2ノイズの多い意味的監視を視覚的オラクルに置き換えると、GZSLモデルの性能はどのように変化するか?
  • RQ3入力・ラベル・意味的データの間で完全なペアワイズ相互作用を持つ3ノードのグラフィカルモデルは、チェーン構造モデルと比較して一般化性能をどの程度向上させるか?
  • RQ4視覚的意味的埋め込みは、一般化ゼロショット設定において、学習済みクラスと未学習クラスの両方で一般化可能か?
  • RQ5提案手法は、意味的および視覚的監視の両方において、最先端のGZSLアプローチを上回る性能を示せるか?

主な発見

  • 提案された視覚的意味的埋め込みは、意味的属性スコアと類似する部品タイプの存在確率を学習することで、視覚的・意味的ギャップを顕著に低減した。
  • CUBデータセットでは、視覚的監視を用いた場合、ベースラインと比較して調和平均精度が12.8%絶対的に向上した。
  • AWA2データセットでは、DEVISEベースラインを視覚的監視で再訓練した場合、調和平均精度が13.4%絶対的に向上した。
  • 構造化された視覚的埋め込みは、グローバル特徴表現よりも優れた性能を示し、部品レベルの構造が性能に不可欠であることを示している。
  • 視覚的オラクルは、複数のデータセットおよびモデルで一貫してGZSL性能を向上させ、既存手法における意味的ノイズが主要なボトルネックであることを実証した。
  • 入力・ラベル・意味的データの間で完全なペアワイズ相互作用を持つ3ノードのグラフィカルモデルは、チェーン構造モデルよりも優れた推論性能を示し、ラベル・意味的・入力の共同モデリングの重要性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。