[论文解读] Domain segmentation and adjustment for generalized zero-shot learning
该论文提出了一种广义零样本学习(GZSL)的领域分割与调整框架,避免依赖生成模型或未见语义数据。通过结合Softmax置信度阈值与极值理论(EVT)进行分布分析,将测试样本划分为已见、未见和不确定领域,随后在不确定区域应用校准堆叠(CS)以平衡预测——在五个基准数据集上实现了新的SOTA性能,且未使用未见类别信息。
In the generalized zero-shot learning, synthesizing unseen data with generative models has been the most popular method to address the imbalance of training data between seen and unseen classes. However, this method requires that the unseen semantic information is available during the training stage, and training generative models is not trivial. Given that the generator of these models can only be trained with seen classes, we argue that synthesizing unseen data may not be an ideal approach for addressing the domain shift caused by the imbalance of the training data. In this paper, we propose to realize the generalized zero-shot recognition in different domains. Thus, unseen (seen) classes can avoid the effect of the seen (unseen) classes. In practice, we propose a threshold and probabilistic distribution joint method to segment the testing instances into seen, unseen and uncertain domains. Moreover, the uncertain domain is further adjusted to alleviate the domain shift. Extensive experiments on five benchmark datasets show that the proposed method exhibits competitive performance compared with that based on generative models.
研究动机与目标
- 解决广义零样本学习(GZSL)中的领域偏移问题,且不依赖生成模型或未见语义信息。
- 缓解将未见语义嵌入投影到仅在已见类别上训练的视觉空间时引入的偏差。
- 开发一种稳健、数据驱动的测试时领域分割方法,以分离已见、未见和不确定样本。
- 通过校准堆叠(CS)调整不确定领域中的预测,提升泛化能力。
- 实证比较合成未见数据与CS在GZSL中的有效性,挑战生成模型为必需的假设。
提出的方法
- 在已见类别上训练Softmax分类器,以获取测试实例的置信度分数。
- 应用极值理论(EVT)对每个已见类别的视觉特征尾部分布进行建模,识别指示分布外样本的极端值。
- 采用联合阈值与概率分布方法,基于Softmax置信度和EVT-based异常得分,将测试实例划分为三个领域:已见、未见和不确定。
- 对于不确定领域样本,应用校准堆叠(CS)以平衡其到已见和未见类别原型的预测距离。
- 该方法在训练过程中不使用任何未见类别语义向量,保持ZSL假设中未见类别在学习期间不可见的前提。
- 该框架在五个标准GZSL基准上端到端评估,且未访问未见类别数据。
实验结果
研究问题
- RQ1基于置信度与分布分析的领域分割能否有效分离GZSL中的已见、未见和不确定测试样本?
- RQ2校准堆叠(CS)是否优于或能模拟生成模型在提升GZSL性能方面的效果?
- RQ3通过生成模型合成未见数据在GZSL中是否真正有益,还是可能引入非预期偏差?
- RQ4所提方法与依赖生成模型或未见语义信息的SOTA方法相比表现如何?
- RQ5仅聚焦于领域分割与不确定性调整的简单非生成方法能否在GZSL中实现SOTA性能?
主要发现
- 所提方法在五个基准数据集(awa1, awa2, aPY, CUB, 和 FLO)上实现了新的SOTA性能,且未使用任何未见类别信息。
- 在FLO数据集上,该方法实现了61.8%的平均每类Top-1准确率,显著优于基线(38.4%)和使用f-CLSWGAN生成数据的基线(45.5%)。
- 仅使用校准堆叠(CS)即达到61.8%的准确率,超过使用f-CLSWGAN生成数据的设置(45.5%),表明在该设定下CS比数据增强更有效。
- 基线模型将37.4%的未见实例错误预测为已见类别,而所提方法通过领域分割与CS显著降低了此类错误。
- 预测距离的分布显示,CS有效减少了在不确定区域对已见类别的偏差,从而改善了泛化性能。
- 结果表明,生成模型可能并非GZSL的理想选择,因为其生成器仅在已见数据上训练,可能无意中损害已见类别识别性能,而CS恰好纠正了此类影响。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。