Skip to main content
QUICK REVIEW

[論文レビュー] Long Tail Visual Relationship Recognition with Hubless Regularized Relmix

Sherif Abdelkarim, Aniket Agarwal|arXiv (Cornell University)|Mar 25, 2020
Multimodal Machine Learning Applications参考文献 56被引用数 4
ひとこと要約

本稿では、長尾分布を示す視覚的関係認識(LTVRR)を導入し、希少な視覚的関係クラスの認識性能を向上させるために、新しい視覚言語的ハブレス(ViLHub)損失関数と関係特化型Mixup(RelMix)増幅手法を提案する。本手法は、2つの新しい長尾ベンチマーク、VG8K-LTおよびGQA-LTにおいて最先端の性能を達成し、ヘッドクラスの正確性を維持したまま、テールクラスの性能を顕著に向上させた。

ABSTRACT

Several approaches have been proposed in recent literature to alleviate the long-tail problem, mostly in the object classification task. We propose to study the task of Long-Tail Visual Relationship Recognition (LTVRR), which aims at generalizing on the structured long-tail distribution of visual relationships (e.g., rabbit grazing on grass). In this setup, subject, relation, and object classes individually follow a long-tail distribution. We first introduce two large-scale long-tail visual relationship recognition benchmarks to study this task, dubbed as VG8K-LT (5330 objects, 2000 relationships) and GQA-LT (1703 objects, 310 relations). VG8K-LT and GQA-LT are built upon the widely used Visual Genome and GQA datasets. In contrast to existing benchmarks, some classes appear at a very low frequency ($1-14$ examples). We use these benchmarks to study the performance of several state-of-the-art long-tail models on LTVRR setup. We developed a visiolinguistic hubless (ViLHub) loss that consistently encourages visual classifiers to be more predictive of tail classes while being accurate on the head. We also propose relationship Mixup augmentation, dubbed as RelMix, to improve performance on the tail on VG8K-LT and GQA-LT benchmarks with the best performance achieved when combined with ViLHub loss. Benchmarks and code will be made available.

研究の動機と目的

  • 視覚的関係認識における長尾分布問題に取り組むこと。具体的には、主語、関係、目的語の各クラスに顕著な不均衡が生じる状況を想定する。
  • 現実的な長尾分布を反映した大規模な新規ベンチマーク、VG8K-LTおよびGQA-LTを構築すること。希少クラスは1〜14例の極めて少ないサンプル数を有する。
  • ヘッドクラスの正確性を損なわず、テールクラスの予測信頼性を向上させる視覚言語的ハブレス(ViLHub)損失関数を提案すること。
  • 低頻度の視覚的関係に対して一般化性能を向上させる関係特化型Mixup増幅法(RelMix)を設計すること。
  • 新規ベンチマーク上で最先端の長尾手法を評価し、LTVRR分野における新たなSOTAを確立すること。

提案手法

  • ViLHub損失は、ヘッドクラスとテールクラスの予測分布の乖離を最小化することで、視覚的分類器がテールクラスに対してより予測的になるように正則化する視覚言語的技術である。
  • 訓練中に適用され、視覚的表現を言語的事前知識と一致させることで、ヘッドクラスにおける過信を軽減し、希少な関係への一般化性能を向上させる。
  • RelMixは、主語-関係-目的語の三つ組みを用いて、視覚的関係のサンプル間で補間を行い、合成された訓練例を生成する。これにより、希少な組み合わせの多様性とカバレッジが向上する。
  • ViLHub損失とRelMix増幅を組み合わせることで、ヘッドクラスとテールクラスの両方の性能を同時に最適化可能となる。
  • VG8K-LTおよびGQA-LTベンチマークは、Visual GenomeおよびGQAデータセットから、極端なクラス不均衡を持つ長尾分布のみを保持するようにフィルタリングすることで構築された。
  • モデルの訓練には対照的学習とマルチタスク監視を用い、ViLHubは損失関数の段階、RelMixはデータ増幅の段階に統合された。

実験結果

リサーチクエスチョン

  • RQ1提案されたViLHub損失は、標準的な交差エントロピー損失と比較して、希少な視覚的関係クラスの認識性能にどのように寄与するか?
  • RQ2RelMixデータ増幅戦略は、長尾設定下での低頻度視覚的関係に対する一般化性能をどの程度向上させるか?
  • RQ3新規に導入されたVG8K-LTおよびGQA-LTベンチマーク上で、既存の最先端長尾手法はどのように性能を示すか?
  • RQ4ViLHubとRelMixを併用した場合、テールクラスの正確性およびモデル全体の頑健性にどのような合成的効果が現れるか?
  • RQ5提案手法は、クラス不均衡の程度が異なるさまざまな長尾視覚的関係データセットに対しても汎用性を示せるか?

主な発見

  • ViLHub損失はテールクラスの予測性能を顕著に向上させ、低頻度関係のF1スコアに明確な向上をもたらした。
  • RelMix増幅は単独でもテールクラス性能を向上させ、ViLHubと組み合わせることで、VG8K-LTおよびGQA-LTの両ベンチマークで最高の全体的正確性を達成した。
  • 提案手法は、VG8K-LTおよびGQA-LTの両方で最先端の性能を達成し、ヘッドクラスおよびテールクラスの両方の認識において、既存の長尾手法を上回った。
  • ベンチマークVG8K-LTおよびGQA-LTは、既存のモデルが極端な長尾分布、特に10例未満のトレーニング例を持つ関係に対して著しく困難を抱えることを明らかにした。
  • アブレーションスタディの結果、ViLHubとRelMixは相乗的に寄与しており、両方のモジュールを併用した場合に最も高い性能が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。