Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Infer Unseen Single-/Multi-Attribute-Object Compositions with Graph Networks

Hui Chen, Jiang, Jingjing|arXiv (Cornell University)|Oct 27, 2020
Domain Adaptation and Few-Shot Learning参考文献 50被引用数 7
ひとこと要約

本稿では、視覚的特徴と単語埋め込みラベルを共有の潜在空間にマッピングすることで、未学習の単一および複数属性オブジェクトの組み合わせを推論するグラフニューラルネットワークベースのモデルを提案する。組み合わせ認識は、意味的距離の最小化により実行される。本手法は、特に視覚的に類似した組み合わせを区別する際、未学習の組み合わせにおいて最先端の性能を達成し、116,099枚の画像と8,030のカテゴリを有する新規のマルチ属性データセット(MAD)を導入する。

ABSTRACT

Inferring the unseen attribute-object composition is critical to make machines learn to decompose and compose complex concepts like people. Most existing methods are limited to the composition recognition of single-attribute-object, and can hardly learn relations between the attributes and objects. In this paper, we propose an attribute-object semantic association graph model to learn the complex relations and enable knowledge transfer between primitives. With nodes representing attributes and objects, the graph can be constructed flexibly, which realizes both single- and multi-attribute-object composition recognition. In order to reduce mis-classifications of similar compositions (e.g., scratched screen and broken screen), driven by the contrastive loss, the anchor image feature is pulled closer to the corresponding label feature and pushed away from other negative label features. Specifically, a novel balance loss is proposed to alleviate the domain bias, where a model prefers to predict seen compositions. In addition, we build a large-scale MultiAttribute Dataset (MAD) with 116,099 images and 8,030 label categories for inferring unseen multi-attribute-object compositions. Along with MAD, we propose two novel metrics Hard and Soft to give a comprehensive evaluation in the multi-attribute setting. Experiments on MAD and two other single-attribute-object benchmarks (MIT-States and UT-Zappos50K) demonstrate the effectiveness of our approach.

研究の動機と目的

  • 訓練中に見られなかった属性オブジェクト組み合わせを認識する課題に取り組むこと、特に視覚的に類似した組み合わせがある場合に焦点を当てる。
  • 属性とオブジェクトの間の相関関係を、意味的関係を捉えるグラフ構造表現を用いてモデル化すること。
  • 抽象的属性の内在的特徴表現とそれらをオブジェクトと組み合わせた表現を学習することで、ゼロショット一般化を向上させること。
  • マルチ属性組み合わせ認識の研究を支援する大規模かつ多様なデータセット(MAD)を構築すること。
  • 現実世界の視覚理解タスクにおける、複雑で未学習の属性オブジェクト組み合わせの柔軟でスケーラブルな認識を可能にすること。

提案手法

  • モデルは、画像の視覚的特徴と属性オブジェクトラベルの埋め込み(事前学習済みのword2vecを用いて)を、グラフ畳み込みネットワーク(GCN)を用いて共有の潜在空間にマッピングする。
  • 同じ組み合わせの特徴を圧縮し、異なる組み合わせ間のマージンを拡大するために、組み合わせクラスタリング機構を導入する。
  • GCNの隣接行列をスパース正則化を伴ってエンドツーエンドで学習することで、属性オブジェクトペア間の意味的相関を捉える。
  • 推論は、潜在空間における画像特徴と最も近い(コサイン距離で)組み合わせの意味的埋め込みを探索することで実行される。
  • 同じ組み合わせ内での特徴の凝縮と異なる組み合わせ間での分離を促進するために、シアン型の対照的損失を用いる。
  • 本手法は新規の大規模データセット(MAD)で訓練され、3つのベンチマーク(MIT-States、UT-Zappos50K、MAD)で評価される。

実験結果

リサーチクエスチョン

  • RQ1学習された属性とオブジェクト間の意味的関係を活用することで、グラフベースのモデルは未学習の属性オブジェクト組み合わせを効果的に認識できるか?
  • RQ2視覚的に類似した組み合わせ(例:「スライスしたトマト」と「スライスしたアップル」)をどれほど正確に区別できるか?
  • RQ3グラフ構造は、アノテーションされていない属性オブジェクト相関(例:「ファountainペン」と「ボールペン」)をどれほど意味的に適切に捉えられるか?
  • RQ4単一属性ベースラインと比較して、複数属性組み合わせへの一般化性能はどの程度向上するか?
  • RQ5アーキテクチャの選択(例:バッチサイズ、深さ)がモデルの性能とロバストネスに与える影響はいかほどか?

主な発見

  • 提案手法は、MADデータセットのクローズドセットスプリットでトップ1正解率33.3%、オープンセットスプリットで16.0%を達成し、未学習の組み合わせ認識において最先端の性能を示した。
  • MIT-StatesおよびUT-Zappos50Kにおいて、ベースライン手法を顕著に上回り、視覚的に曖昧な組み合わせの処理において特に優れた性能を示した。
  • t-SNE可視化により、組み合わせクラスタリング機構が同じ組み合わせの特徴を効果的にグループ化し、異なる組み合わせ間のマージンを拡大していることが確認された。
  • 学習された隣接行列は、トレーニング例がなくても意味的で適切な相関関係を明らかにした—例として「散らかっている」は「ロープ」とも関連づけられている—これは、モデルが意味的関係を推論できることを示している。
  • モデルは深さおよびバッチサイズに対してロバストであり、GCN層が3〜4層で性能がピークに達し、異なるバッチサイズでも安定した結果を示した。
  • アブレーションスタディにより、グラフ構造と組み合わせクラスタリング機構の両方が性能に不可欠であることが確認され、特に視覚的に類似した組み合わせの区別において顕著な寄与を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。