Skip to main content
QUICK REVIEW

[论文解读] Long Tail Visual Relationship Recognition with Hubless Regularized Relmix

Sherif Abdelkarim, Aniket Agarwal|arXiv (Cornell University)|Mar 25, 2020
Multimodal Machine Learning Applications参考文献 56被引用 4
一句话总结

本文提出了长尾视觉关系识别(LTVRR),并提出了一种新颖的视觉-语言无中心(ViLHub)损失和关系Mixup(RelMix)增强方法,以提升在罕见视觉关系类别上的识别性能。该方法在两个新的长尾基准数据集VG8K-LT和GQA-LT上取得了最先进(SOTA)的结果,显著提升了尾部类别性能,同时保持了头部类别的准确率。

ABSTRACT

Several approaches have been proposed in recent literature to alleviate the long-tail problem, mostly in the object classification task. We propose to study the task of Long-Tail Visual Relationship Recognition (LTVRR), which aims at generalizing on the structured long-tail distribution of visual relationships (e.g., rabbit grazing on grass). In this setup, subject, relation, and object classes individually follow a long-tail distribution. We first introduce two large-scale long-tail visual relationship recognition benchmarks to study this task, dubbed as VG8K-LT (5330 objects, 2000 relationships) and GQA-LT (1703 objects, 310 relations). VG8K-LT and GQA-LT are built upon the widely used Visual Genome and GQA datasets. In contrast to existing benchmarks, some classes appear at a very low frequency ($1-14$ examples). We use these benchmarks to study the performance of several state-of-the-art long-tail models on LTVRR setup. We developed a visiolinguistic hubless (ViLHub) loss that consistently encourages visual classifiers to be more predictive of tail classes while being accurate on the head. We also propose relationship Mixup augmentation, dubbed as RelMix, to improve performance on the tail on VG8K-LT and GQA-LT benchmarks with the best performance achieved when combined with ViLHub loss. Benchmarks and code will be made available.

研究动机与目标

  • 为解决视觉关系识别中的长尾分布问题,其中主体、关系和对象类别高度不平衡。
  • 构建新的大规模基准数据集VG8K-LT和GQA-LT,以反映现实中的长尾分布,其中罕见类别仅包含1至14个样本。
  • 提出一种视觉-语言无中心(ViLHub)损失,以在不牺牲头部类别准确率的前提下,提升对尾部类别的预测置信度。
  • 设计一种针对关系的Mixup增强方法(RelMix),以提升在低频视觉关系上的泛化能力。
  • 在新基准上评估最先进长尾方法,并为LTVRR建立新的SOTA性能。

提出的方法

  • ViLHub损失是一种视觉-语言正则化技术,通过最小化头部与尾部预测之间的分布差异,促使视觉分类器更准确地预测尾部类别。
  • 该损失在训练过程中应用,以对齐视觉表征与语言先验,减少对头部类别的过度自信,并提升对罕见关系的泛化能力。
  • RelMix通过其主体-关系-对象三元组对视觉关系样本进行插值,生成合成训练样本,从而增加罕见组合的多样性与覆盖度。
  • 该方法将ViLHub损失与RelMix增强相结合,实现对头部和尾部类别性能的联合优化。
  • 基准数据集VG8K-LT和GQA-LT通过筛选Visual Genome和GQA数据集构建,仅保留具有极端类别不平衡的长尾分布。
  • 模型训练采用对比学习和多任务监督,其中ViLHub集成于损失阶段,RelMix集成于数据增强阶段。

实验结果

研究问题

  • RQ1与标准交叉熵损失相比,所提出的ViLHub损失在罕见视觉关系类别上的识别性能提升程度如何?
  • RQ2在长尾设置下,RelMix数据增强策略在低频视觉关系上的泛化能力提升程度如何?
  • RQ3当在新引入的VG8K-LT和GQA-LT基准上评估时,现有最先进长尾方法的表现如何?
  • RQ4ViLHub与RelMix的联合效应如何影响尾部类别准确率和整体模型鲁棒性?
  • RQ5所提出方法能否在具有不同类别不平衡水平的多种长尾视觉关系数据集上实现良好泛化?

主要发现

  • ViLHub损失显著提升了对尾部类别的预测性能,在低频关系上F1分数有明显提升。
  • 仅使用RelMix增强即可提升尾部类别性能,而与ViLHub结合后在VG8K-LT和GQA-LT两个基准上均达到最高整体准确率。
  • 所提方法在VG8K-LT和GQA-LT上均取得了最先进性能,无论在头部还是尾部类别识别上均优于现有长尾方法。
  • 基准数据集VG8K-LT和GQA-LT表明,现有模型在极端长尾分布下表现不佳,尤其在训练样本少于10个的关系上。
  • 消融实验确认ViLHub与RelMix具有协同作用,当两者同时使用时性能最佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。