Skip to main content
QUICK REVIEW

[論文レビュー] A Large-scale Attribute Dataset for Zero-shot Learning

Bo Zhao, Yanwei Fu|arXiv (Cornell University)|Apr 12, 2018
Domain Adaptation and Few-Shot Learning参考文献 47被引用数 6
ひとこと要約

本稿では、78,017枚の画像と230クラス(動物、果物、車両、家電製品、ヘアスタイルの5つのスーパークラスに分類)を有し、359の視覚的・意味的・主観的属性をアノテーションした、ゼロショット学習のための新規ベンチマークであるLarge-scale Attribute Dataset (LAD) を紹介する。本データセットは、複数オブジェクトを含む画像をフィルタリングすることで共起バイアスを低減し、細分化された多様な属性に対する挑戦的なゼロショット学習および生成タスクを可能にした。実験の結果、最新のモデルですら、特に『ヘアスタイル』スーパークラスにおいて、細分化された属性に対して困難を示すことが明らかになった。

ABSTRACT

Zero-Shot Learning (ZSL) has attracted huge research attention over the past few years; it aims to learn the new concepts that have never been seen before. In classical ZSL algorithms, attributes are introduced as the intermediate semantic representation to realize the knowledge transfer from seen classes to unseen classes. Previous ZSL algorithms are tested on several benchmark datasets annotated with attributes. However, these datasets are defective in terms of the image distribution and attribute diversity. In addition, we argue that the "co-occurrence bias problem" of existing datasets, which is caused by the biased co-occurrence of objects, significantly hinders models from correctly learning the concept. To overcome these problems, we propose a Large-scale Attribute Dataset (LAD). Our dataset has 78,017 images of 5 super-classes, 230 classes. The image number of LAD is larger than the sum of the four most popular attribute datasets. 359 attributes of visual, semantic and subjective properties are defined and annotated in instance-level. We analyze our dataset by conducting both supervised learning and zero-shot learning tasks. Seven state-of-the-art ZSL algorithms are tested on this new dataset. The experimental results reveal the challenge of implementing zero-shot learning on our dataset.

研究の動機と目的

  • 既存のゼロショット学習(ZSL)データセットに見られる、スケールの小ささ、属性の多様性の不足、複数オブジェクト画像に起因する共起バイアスといった制限を解消すること。
  • 複数の視覚的ドメインにまたがる細分化された知識移行を可能にする、大規模で多様かつバランスの取れた属性データセットの構築。
  • 『人間』と『犬』の間の誤った相関関係のような共起バイアスを低減するため、1つの前面オブジェクトのみを含む画像を収集することで、特にそのバイアスを軽減すること。
  • 現実的で複雑かつ細分化された属性条件下で、ZSLおよびゼロショット生成(ZSG)アルゴリズムの評価が可能な、新たなベンチマークを提供すること。
  • 視覚的属性に加え、意味的および主観的特性(例:食事、機能、食用、安全性、人間の感情)を統合することで、より強固で一般化可能なZSLモデルの実現を支援すること。

提案手法

  • データセットは、動物、果物、車両、家電製品、ヘアスタイルの5つのスーパークラスから構成され、それぞれドメイン固有の属性を持つ。
  • 画像は多様なソースから収集され、共起バイアスを低減するため、1つのオブジェクトのみを含むシーンにフィルタリングされている。
  • 359の属性がインスタンスレベルでアノテーションされており、視覚的(例:色、形状)、意味的(例:食事、機能)、主観的(例:安全性、人間の感情)特性を含む。
  • 各スーパークラスごとに、属性の関連性と識別性を高めるために、独自のラベルリストを考案した。
  • 7つの最先端のZSLアルゴリズムを、教師ありおよびゼロショット学習の両プロトコルでLAD上で評価した。
  • ゼロショット生成のため、属性ベクトルを条件として用いた条件付きDCGANを訓練し、未学習クラスの新しい属性組み合わせに基づく画像生成を実現した。

実験結果

リサーチクエスチョン

  • RQ1大規模で多様かつバイアス低減型の属性データセットは、ゼロショット学習モデルの一般化性能および耐性を向上させ得るか?
  • RQ2『人間』と『犬』の頻繁なペairingのような共起バイアスは、ZSLモデルの性能にどの程度悪影響を及えるか?
  • RQ3視覚的属性に加え、意味的および主観的属性を含む細分化されたカテゴリにおいて、ゼロショット学習はどの程度困難であるか?
  • RQ4最先端のZSLモデルは、LADのような高頻度で多様な属性を持つ細分化されたデータセットにおいて、未学習クラスに効果的に一般化できるか?
  • RQ5条件付きGANは、未学習クラスの新しい属性表現に基づいて、信憑性のある画像を効果的に生成できるか?

主な発見

  • LADデータセットには、230クラスにわたる78,017枚の画像と359の属性が含まれており、4つの最も人気のある属性データセットの合計画像数を上回っている。
  • 7つの最先端ZSLアルゴリズムすべてが、『ヘアスタイル』スーパークラスにおいて顕著に低い性能を示しており、未学習クラスが6つしかない状況でも高い難易度であることが示された。
  • SOC法(2009)が、『ヘアスタイル』スーパークラスにおいて、すべての最新ZSLアルゴリズムを上回る性能を示した。これは、現在のモデルが主観的または細分化された属性に最適化されていない可能性を示唆している。
  • 共起バイアスは、AwAにおいて実証的に検証された。『人間』が15の動物クラスの10%以上を占めており、AwAで学習したGANは、実際の画像に『人間』が存在しないにもかかわらず、『人間』を生成した。
  • 条件付きDCGANは、未学習クラスの妥当な画像(例:『泳げる』と『飛べる』を同時に有する)を効果的に生成でき、LAD上でのゼロショット生成の可能性を示した。
  • 本データセットは、バイアスのある複数オブジェクトデータセットで学習したモデルが、誤った相関関係を学習し、新しいドメインで誤分類や一般化性能の低下を引き起こす可能性があることを明らかにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。