Skip to main content
QUICK REVIEW

[論文レビュー] Transductive Zero-Shot Learning with a Self-training dictionary approach

Yunlong Yu, Zhong Ji|arXiv (Cornell University)|Mar 27, 2017
Domain Adaptation and Few-Shot Learning参考文献 30被引用数 5
ひとこと要約

本稿では、信頼性の高い未学習インスタンスを用いた自己学習戦略により予測を段階的に改善することで一般化性能を向上させる、トランスductive zero-shot learning手法TSTDを提案する。画像特徴量とラベル埋め込みを双方向辞書モデルによって共有の潜在空間に同時に投影することにより、意味的ギャップとドメインシフトを低減し、視覚的属性を用いてAwA(90.3%)およびCUB(58.2%)で最先端の性能を達成する。

ABSTRACT

As an important and challenging problem in computer vision, zero-shot learning (ZSL) aims at automatically recognizing the instances from unseen object classes without training data. To address this problem, ZSL is usually carried out in the following two aspects: 1) capturing the domain distribution connections between seen classes data and unseen classes data; and 2) modeling the semantic interactions between the image feature space and the label embedding space. Motivated by these observations, we propose a bidirectional mapping based semantic relationship modeling scheme that seeks for crossmodal knowledge transfer by simultaneously projecting the image features and label embeddings into a common latent space. Namely, we have a bidirectional connection relationship that takes place from the image feature space to the latent space as well as from the label embedding space to the latent space. To deal with the domain shift problem, we further present a transductive learning approach that formulates the class prediction problem in an iterative refining process, where the object classification capacity is progressively reinforced through bootstrapping-based model updating over highly reliable instances. Experimental results on three benchmark datasets (AwA, CUB and SUN) demonstrate the effectiveness of the proposed approach against the state-of-the-art approaches.

研究の動機と目的

  • 学習済みの既知クラスにのみ適用可能なモデルが未学習クラスに一般化できないというゼロショット学習(ZSL)におけるドメインシフト問題に対処する。
  • 共有の潜在空間を学習することで、画像特徴量と意味的ラベル埋め込みの間のクロスモーダル整合性を向上させる。
  • 静的でノイズが多く、スパarsなラベル埋め込みの限界を、信頼性の高い自己ラベル化された未学習インスタンスを用いた段階的な予測の改善によって克服する。
  • 高信頼度の予測に基づく再訓練によってモデル容量を向上させるブートストラップベースの再訓練を組み込んだトランスductiveフレームワークを構築する。
  • 双方向的意味モデリングと反復的自己学習を組み合わせることで、ベンチマークZSLデータセットで最先端の性能を達成する。

提案手法

  • 画像特徴量とラベル埋め込みを同時に共通の潜在空間に投影する双方向辞書モデルを提案し、クロスモーダルな意味的関係を保持する。
  • ZSL問題を、未学習のインスタンスを用いて段階的にモデルを改善するトランスductive学習タスクとして定式化する。
  • 反復的二段階パラダイムを実装する:(1) 予測の学習(現在のモデルで未学習データを分類)、(2) 学習の予測(高信頼度の予測を用いてモデルを再訓練)。
  • 自己ラベル化率の閾値δを用いて、再訓練に使用する高信頼度予測の割合を制御し、信頼性の高いインスタンスのみを選択する。
  • ブートストラップベースのモデル更新を適用し、最も信頼度の高い予測にモデルを強化することで、段階的に分類能力を向上させる。
  • 既存のインダクティブモデル(例:JEDM、CCA、ESZSL)に自己学習戦略を適用することで、性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1画像特徴量とラベル埋め込みを共有の潜在空間に同時に投影する双方向辞書モデルは、ゼロショット学習における意味的ギャップを効果的に低減し、クロスモーダル整合性を向上させることができるか?
  • RQ2信頼度に基づいて未学習インスタンスを選択する反復的自己学習は、単一パスのトランスductive手法と比較して、モデルの一般化性能をどのように向上させるか?
  • RQ3提案されたトランスductiveフレームワークは、信頼性の高い予測を段階的に活用することで、ゼロショット学習におけるドメインシフトをどの程度軽減できるか?
  • RQ4自己ラベル化率δはモデル性能にどのように影響するか?最適な閾値は、ノイズの導入を防ぎつつ性能向上を保証するか?
  • RQ5提案手法は、AwA、CUB、SUNといった標準ベンチマークで、既存の最先端のトランスductive ZSLアプローチを上回る性能を示すか?

主な発見

  • 提案されたTSTD手法は、視覚的属性を用いてAwAデータセットで90.3%の正確度を達成し、2番目に良い手法より2.4ポイント高い性能を示した。
  • CUBデータセットでは、視覚的属性を用いて58.2%の正確度を達成し、2番目に良い手法より4.7ポイントの向上を示した。
  • 自己学習戦略により、ベースのJEDMモデルは視覚的属性を用いてAwAで10.6ポイント、CUBで3.0ポイントの向上を示した。
  • AwAではδ = 0.8で性能がピークに達し、初期予測が信頼できる場合、高い自己ラベル化率がモデル成熟を促進することが示された。
  • CUBではδ = 0.6(属性)およびδ = 0.4(語彙ベクトル)で性能がピークに達し、初期モデル性能が低い場合には低い閾値がより効果的であることが示された。
  • 反復的自己学習フレームワークは、インダクティブモデルの一般化性能を顕著に向上させ、高信頼度の予測を段階的に活用するアプローチがドメインシフトを低減するのに有効であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。