[论文解读] LCReg: Long-Tailed Image Classification with Latent Categories based Recognition
LCReg 通过学习跨头类和尾类共享的类别无关潜在特征,解决长尾图像分类问题,实现在潜在空间中的语义数据增强,从而提升特征多样性与表征能力。该方法在五个长尾基准数据集上达到最先进性能,显著优于现有基线方法。
In this work, we tackle the challenging problem of long-tailed image recognition. Previous long-tailed recognition approaches mainly focus on data augmentation or re-balancing strategies for the tail classes to give them more attention during model training. However, these methods are limited by the small number of training images for the tail classes, which results in poor feature representations. To address this issue, we propose the Latent Categories based long-tail Recognition (LCReg) method. Our hypothesis is that common latent features shared by head and tail classes can be used to improve feature representation. Specifically, we learn a set of class-agnostic latent features shared by both head and tail classes, and then use semantic data augmentation on the latent features to implicitly increase the diversity of the training sample. We conduct extensive experiments on five long-tailed image recognition datasets, and the results show that our proposed method significantly improves the baselines.
研究动机与目标
- 解决因训练样本有限而导致的长尾图像识别中尾类特征表征能力差的问题。
- 克服传统数据增强与重平衡策略的局限性,这些策略无法有效提升尾类的特征多样性。
- 利用头类与尾类之间的共享结构与语义共性(如动物的腿),提升模型泛化能力。
- 构建一个稳健的、类别无关的潜在特征空间,实现在不依赖类别不平衡的前提下有效数据增强。
- 通过潜在语义增强与重建损失,提升模型在长尾数据集上的泛化能力与性能表现。
提出的方法
- 引入一个类别无关的潜在特征池,通过反向传播学习所有类别间共享的物体部件(如腿、头)特征。
- 通过潜在特征的相似性加权和重建原始图像特征,并引入重建损失以确保表征的语义意义。
- 使用从多元正态分布中采样的类别特定扰动,对潜在特征实施语义数据增强。
- 采用加权损失函数,联合优化交叉熵损失、重建损失与潜在增强损失,以同步优化特征学习与泛化能力。
- 通过从共享物体部件中提取的语义方向对潜在特征进行变换,实现潜在空间增强,提升多样性,且不依赖原始图像数据。
- 采用平衡的潜在空间进行端到端训练,将特征学习与类别特定的数据稀缺性解耦。
实验结果
研究问题
- RQ1头类与尾类之间共享的潜在特征是否能改善长尾图像分类中的表征学习?
- RQ2在潜在空间中进行特征增强(而非原始图像空间)是否能提升在类别不平衡数据集上的性能?
- RQ3使用类别无关的潜在特征如何影响模型在长尾数据上的泛化能力与鲁棒性?
- RQ4潜在语义数据增强在多大程度上优于传统数据增强与重平衡方法?
- RQ5所提出方法对损失加权与潜在特征维度的超参数选择有多敏感?
主要发现
- LCReg 在五个长尾基准数据集上达到最先进性能:CIFAR-10-LT(不平衡比100时为91.0%)、CIFAR-100-LT(不平衡比100时为64.1%)、ImageNet-LT、iNaturalist 2018 和 Places-LT。
- 该方法在 CIFAR-10-LT 上将基线准确率提升最高达 3.0%,在 CIFAR-100-LT 上提升最高达 4.0%,显著优于现有方法。
- 潜在特征增强($L_{Aug}$)优于直接在原始特征上应用 ISDA,CIFAR-10-LT(不平衡比100)上准确率分别达到 82.5% 与 79.8%。
- 该方法对超参数选择具有鲁棒性,$eta$、$eta$ 与 $eta$ 的不同取值下性能下降极小,表明优化过程稳定且灵活。
- KL 散度分析表明,潜在特征捕捉到了跨类别的有意义共享语义结构,头类与尾类表征之间的散度较低。
- 消融实验表明,重建损失与潜在增强共同提升性能,当所有模块同时使用时取得最佳结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。