[论文解读] Retrieval Augmented Classification for Long-Tail Visual Recognition
本文提出检索增强分类(RAC),一种通过将检索模块与外部预编码图像和文本记忆相结合来增强标准图像分类的方法。RAC 在长尾基准测试中实现最先进性能——在Places365-LT和iNaturalist-2018上分别实现14.5%和6.7%的相对提升,通过使检索分支隐式学习尾部类别表征,从而让基础编码器能够专注于头部类别而无需微调。
We introduce Retrieval Augmented Classification (RAC), a generic approach to augmenting standard image classification pipelines with an explicit retrieval module. RAC consists of a standard base image encoder fused with a parallel retrieval branch that queries a non-parametric external memory of pre-encoded images and associated text snippets. We apply RAC to the problem of long-tail classification and demonstrate a significant improvement over previous state-of-the-art on Places365-LT and iNaturalist-2018 (14.5% and 6.7% respectively), despite using only the training datasets themselves as the external information source. We demonstrate that RAC's retrieval module, without prompting, learns a high level of accuracy on tail classes. This, in turn, frees the base encoder to focus on common classes, and improve its performance thereon. RAC represents an alternative approach to utilizing large, pretrained models without requiring fine-tuning, as well as a first step towards more effectively making use of external memory within common computer vision architectures.
研究动机与目标
- 为解决长尾视觉识别中的挑战,即罕见类别因训练数据不足而被频繁类别掩盖。
- 通过引入显式、非参数化的外部记忆来减少对参数量庞大的模型的依赖,以存储视觉知识。
- 在不微调基础模型的前提下,提升对尾部类别的分类性能。
- 探究基于检索的增强是否能在长尾学习中超越现有的基于一致性或集成的方法。
提出的方法
- RAC 将标准基础图像编码器与并行的检索分支相结合,后者查询一个非参数化的外部记忆库,其中包含预编码的图像和相关文本片段。
- 检索模块使用固定的预训练图像编码器(例如 ViT)对图像进行嵌入,并使用文本编码器(例如 BERT 类模型)对相关文本进行编码,从而实现跨模态检索。
- 在推理阶段,检索模块的 logits 与基础编码器的 logits 融合,生成最终预测结果。
- 该方法在大规模索引上使用近似 k-NN 搜索(通过 HNSW 实现),在训练和推理过程中高效检索相关图像-文本对。
- 外部记忆库由训练数据集本身构建——包括图像及其标签或描述——无需依赖外部数据源。
- 基础编码器与检索分支通过修改后的 LACE 损失进行端到端联合训练,实现无需微调检索组件的端到端优化。
实验结果
研究问题
- RQ1基于检索的模块是否能在不微调的情况下有效提升长尾视觉识别基准的分类性能?
- RQ2检索模块是否能在未明确提示的情况下自然聚焦于尾部类别?
- RQ3外部记忆索引的大小和粒度如何影响 RAC 的性能?
- RQ4RAC 是否能超越依赖损失重加权或logit调整的现有最先进方法?
- RQ5将检索模块集成到标准分类流水线中的计算开销如何?
主要发现
- RAC 在 Places365-LT 基准上实现14.5%的相对提升,在 iNaturalist-2018 上实现6.7%的相对提升,超越了先前的最先进方法。
- 检索模块在未明确提示的情况下自然聚焦于尾部类别,显著减轻了基础编码器的负担。
- 性能提升对标签粒度最为敏感——添加具有唯一标签的新类别带来的收益大于在已有标签下增加样本数量。
- 由于检索模块的存在,训练时间仅增加1.5–2倍,其中大部分开销来自文本编码器,而非索引查找。
- 当索引中大多数类别已被表示后,信息含量趋于饱和,因此索引大小的收益随规模增大而递减。
- 该方法在大规模场景下依然高效,1000万以上规模的索引可在单台配备8张A100 GPU的节点上实现实时检索,且训练开销可忽略不计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。