[论文解读] LMC: Large Model Collaboration with Cross-assessment for Training-Free Open-Set Object Recognition
该论文提出 LMC,一种无需训练的开放集物体识别框架,通过利用现成的大模型之间的协同推理,减少对虚假判别特征的依赖。通过采用循环交叉评估模块,使 CLIP 与 ChatGPT 之间通过相互反馈不断优化图像描述,LMC 在无需微调的情况下,在多个基准测试上实现了最先进性能。
Open-set object recognition aims to identify if an object is from a class that has been encountered during training or not. To perform open-set object recognition accurately, a key challenge is how to reduce the reliance on spurious-discriminative features. In this paper, motivated by that different large models pre-trained through different paradigms can possess very rich while distinct implicit knowledge, we propose a novel framework named Large Model Collaboration (LMC) to tackle the above challenge via collaborating different off-the-shelf large models in a training-free manner. Moreover, we also incorporate the proposed framework with several novel designs to effectively extract implicit knowledge from large models. Extensive experiments demonstrate the efficacy of our proposed framework. Code is available https://github.com/Harryqu123/LMC
研究动机与目标
- 解决物体识别中因依赖虚假判别特征而混淆闭集与开集类别的问题。
- 开发一种无需训练的框架,利用多样化大模型中的隐式知识,无需额外数据或微调。
- 通过模拟虚拟开集类别,提升开放集识别的鲁棒性,引导模型避免对虚假特征的过拟合。
- 通过新颖的交叉评估与优化机制,实现对大模型隐式知识的有效提取。
提出的方法
- LMC 通过在 CLIP 与 ChatGPT 之间交换图像-文本表征,协同多个预训练大模型,以增强特征理解。
- 循环交叉评估模块交替优化图像描述:CLIP 生成图像特征,用于改进文本提示;随后,优化后的提示用于生成更优的图像表征。
- 利用文本到图像生成流水线模拟虚拟开集类别,引导模型超越已知类别的泛化能力。
- 该框架采用双分支结构,其中 CLIP 提供视觉对齐,ChatGPT 提供语义定位,通过迭代反馈优化两种模态。
- 在交叉评估过程中应用对比损失,使生成的图像-文本对与目标类别语义对齐。
- 该方法仅在推理阶段运行,部署后无需重新训练或访问训练数据。
实验结果
研究问题
- RQ1具有不同预训练范式的大型模型能否在无需微调的情况下协同提升开放集物体识别性能?
- RQ2如何有效提取并利用大型模型中的隐式知识以支持开放集识别?
- RQ3虚拟开集类别在多大程度上能减少开放集识别中对虚假判别特征的依赖?
- RQ4循环交叉评估机制是否能提升图像-文本表征质量,从而实现更好的开放集泛化?
- RQ5当模拟的虚拟开集类别与真实评估开集类别无重叠时,该框架是否仍能保持高性能?
主要发现
- LMC 在 TinyImageNet 上实现了 93.1 的 AUROC,显著优于 Softmax 基线(83.5)及其他变体。
- 即使在未包含于模拟虚拟开集集合(子集 B)的开集类别上,LMC 仍达到 86.5 的 AUROC,证明其超越简单类别匹配的鲁棒性。
- 循环交叉评估模块减少了对虚假判别特征的依赖,定性结果表明,带有 'with horn' 或 'with beak' 的图像被正确分类为开集。
- 该框架在四种评估协议下均保持强劲性能,证实其泛化能力。
- 可视化结果表明,交叉评估模块显著提升了生成图像的质量,使其更符合目标类别表征。
- 即使模拟的虚拟开集类别与真实评估开集类别的重叠率极低(≤3.4%),该方法仍保持有效性,证明其不依赖于直接匹配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。