Skip to main content
QUICK REVIEW

[論文レビュー] Disentangling Visual Embeddings for Attributes and Objects

Nirat Saini, Khoi Pham|arXiv (Cornell University)|May 17, 2022
Domain Adaptation and Few-Shot Learning被引用数 8
ひとこと要約

本稿では、画像トリプレット(ターゲット、同一オブジェクトだが異なる属性、同一属性だが異なるオブジェクト)を用いた対照学習により、視覚的特徴を独立したオブジェクトおよび属性成分に分離する新規手法であるObject Attribute Disentanglement (OADis) を提案する。分離された特徴から、見たことのあるおよび見未曾な属性-オブジェクトの組み合わせを想起することで、MIT-States、UT-Zappos、および新しいVAWベースのベンチマークにおいて、従来手法と顕著な差をつけて最先端の性能を達成する。

ABSTRACT

We study the problem of compositional zero-shot learning for object-attribute recognition. Prior works use visual features extracted with a backbone network, pre-trained for object classification and thus do not capture the subtly distinct features associated with attributes. To overcome this challenge, these studies employ supervision from the linguistic space, and use pre-trained word embeddings to better separate and compose attribute-object pairs for recognition. Analogous to linguistic embedding space, which already has unique and agnostic embeddings for object and attribute, we shift the focus back to the visual space and propose a novel architecture that can disentangle attribute and object features in the visual space. We use visual decomposed features to hallucinate embeddings that are representative for the seen and novel compositions to better regularize the learning of our model. Extensive experiments show that our method outperforms existing work with significant margin on three datasets: MIT-States, UT-Zappos, and a new benchmark created based on VAW. The code, models, and dataset splits are publicly available at https://github.com/nirat1606/OADis.

研究の動機と目的

  • 標準的な事前学習済み視覚バックボーンでは属性とオブジェクトの特徴が混同されているため、属性認識における構成的ゼロショット学習の課題に対処すること。
  • 事前学習中のデータ拡張によって引き起こされる属性不変表現の制限を克服し、微細な属性学習を妨げる要因を解消すること。
  • 正確な想起(hallucination)が可能となるように、両方の見覚えありおよび見未曾な属性-オブジェクトの組み合わせを実現する分離された視覚的特徴を学習すること。
  • 言語的監視から視覚的空間の分離に焦点を移し、単語埋め込みの構造を模倣するが、視覚ドメインに応用する。
  • 現実世界の複雑なシーンにおける構成的ゼロショット学習のための新しいベンチマーク(VAWに基づく)を導入すること。

提案手法

  • OADisは、オブジェクトに依存するネットワーク、ラベル埋め込みネットワーク、属性/オブジェクトアフィニティネットワークの3つの主要なネットワークを備えたトリプレットベースのアーキテクチャを採用し、視覚的特徴を分離する。
  • 各入力画像に対して、同じオブジェクトだが異なる属性(例:むきあられのりんご vs. 切ったりんご)を持つ参照画像、および同じ属性だが異なるオブジェクト(例:むきあられのりんご vs. むきあられのみかん)を持つ参照画像を検索する。
  • 属性アフィニティネットワークとオブジェクトアフィニティネットワークは、それぞれ入力画像と参照画像間の視覚的類似性および相違性特徴を抽出し、属性およびオブジェクトの分離された表現を分離する。
  • 分離された特徴は、事前学習済みのGloVe単語埋め込みと組み合わせられ、属性およびオブジェクト予測のための分類損失と対照損失を計算する。
  • 分離された特徴を用いて、見覚えあり(例:切ったみかん)および見未曾な(例:スライスされたみかん)組み合わせを想起し、埋め込み空間の正則化に構成性損失を適用する。
  • 訓練中に画像拡張(水平反転およびランダムクロップ)を適用し、すべてのベースラインおよびOADisにおいて性能向上が示された。

実験結果

リサーチクエスチョン

  • RQ1言語的監視に依存せずに、視覚的特徴を独立したオブジェクトおよび属性成分に効果的に分離できるか?
  • RQ2分離された視覚的特徴から新しい属性-オブジェクトの組み合わせを想起することで、構成的学習におけるゼロショット一般化性能が向上するか?
  • RQ3性能およびロバストネスの観点から、視覚的分離は言語的監視と比較してどうなるか?
  • RQ4分離された視覚的特徴に基づいて学習されたモデルは、未確認の組み合わせに対して意味的に適切な類似画像(最近傍)を検索できるか?
  • RQ5オブジェクトが複数の属性を持つ現実世界の多様なシーンにおいて、モデルはどの程度一般化できるか?

主な発見

  • OADisは、MIT-States、UT-Zappos、および新しいVAWベースのベンチマークにおいて、最先端の性能を達成し、従来手法を顕著に上回った。
  • MIT-Statesでは、AUCが88.7%を達成し、前回の最先端手法を5ポイント以上上回った。
  • UT-Zapposでは、AUCが77.3%を達成し、より多様で挑戦的なデータセットに対しても強力な一般化性能を示した。
  • 定性的な結果から、分離された特徴から想起された組み合わせが、未確認ペア(例:スライスされたみかん)に対してもテストセットから関連する画像を正しく検索していることが示された。
  • 真値ラベルがトップ1にない場合でも、トップ3の予測で正確な属性およびオブジェクトの記述が得られており、現実世界のデータのマルチラベル性を反映している。
  • アブレーションスタディにより、オブジェクトに依存するネットワークと画像拡張が性能向上に寄与することが確認され、特に拡張により全手法が約1.0–1.5% AUC向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。