QUICK REVIEW
[论文解读] Data for "Multi-Label Learning from Single Positive Labels" (CVPR 2021)
Elijah Cole|Zenodo (CERN European Organization for Nuclear Research)|Jun 17, 2021
Text and Document Classification Technologies被引用 5
一句话总结
本文提出了一种新颖的损失函数,ROLE(从嵌入中重建标签),用于仅使用每张图像一个正样本标签的多标签图像分类——无需确认的负样本。尽管监督信号大幅减少,该方法仍实现了与完全标注训练相媲美性能,证明即使在标注极少的情况下,有效的多标签学习依然可行。
ABSTRACT
<p>Data for "Multi-Label Learning from Single Positive Labels" (CVPR 2021). </p>
研究动机与目标
- 解决在每张图像仅能获得一个正样本标签时训练多标签图像分类器的挑战,原因在于标注成本高昂且存在大量假阴性样本。
- 探究在极端监督约束条件下(即无确认的负样本标签)是否仍可实现有效的多标签学习。
- 开发并评估一种新的训练目标,该目标在训练过程中估计缺失的正样本标签,从而在监督稀疏的情况下提升泛化能力。
- 在多个基准数据集上,对比各种现有及新型多标签损失函数在单正样本标签设置下的表现。
- 证明极简监督可实现接近全监督的性能,从而实现大规模多标签数据集的低成本数据收集。
提出的方法
- 提出一种新颖的训练损失 $γ_{\text{ROLE}}$,利用可微分的标签估计器 $g$ 在训练过程中估计完整的标签矩阵。
- 将标准多标签损失(如BCE、假设负样本)扩展至单正样本设置,包括标签平滑变体。
- 引入一个标签估计器 $g$,其从图像特征预测完整的 $N \times L$ 标签矩阵,从而实现端到端训练与梯度反向传播。
- 采用两阶段训练策略:首先在冻结特征上训练线性分类器和标签估计器,然后在初始几个周期内使用冻结主干网络进行端到端微调。
- 对假设负样本基线 ($\mathcal{L}_{\text{AN-LS}}$) 应用标签平滑,以提升泛化能力,尤其在单正样本设置下表现更优。
- 在训练过程中将完整的标签矩阵 $g$ 存储并更新于内存中,未来可在更大规模设置中采用因子分解或神经网络近似方法。
实验结果
研究问题
- RQ1当每张图像仅使用一个正样本标签进行训练时,多标签图像分类器能否实现与完全监督模型相当的性能?
- RQ2在极端单正样本监督设置下(尤其无确认负样本标签时),不同多标签损失函数的表现如何,特别是其在该设置下的鲁棒性?
- RQ3学习到的标签估计器在训练过程中对缺失正样本标签的恢复能力有多强?这种恢复能力是否能提升下游分类准确率?
- RQ4初始化策略的选择(特别是早期端到端训练中使用冻结主干网络)是否显著影响单正样本设置下的模型性能?
- RQ5标签平滑在单正样本设置下的泛化性能有何影响?它能否作为该问题的强基线?
主要发现
- $γ_{\text{ROLE}}$ 损失在 PASCAL VOC 2012 数据集上实现了与完全标注训练 ($\mathcal{L}_{\text{BCE}}$) 相当的测试 MAP 性能,尽管仅使用了 1/20 的标签数量。
- 采用标签平滑的假设负样本损失 ($\mathcal{L}_{\text{AN-LS}}$) 在单正样本设置下优于标准假设负样本损失和标准 BCE,成为强有力的基线。
- $γ_{\text{ROLE}}$ 损失在训练过程中对真实未观测标签矩阵的恢复能力优于 $\mathcal{L}_{\text{AN-LS}}$,如图 2 的定性分析所示。
- 尽管 $γ_{\text{ROLE}}$ 的标签恢复能力更优,但其测试 MAP 并不总是高于 $\mathcal{L}_{\text{AN-LS}}$,表明标签恢复能力并不总能转化为测试性能的提升。
- 初始化策略显著影响性能:在端到端训练的前几轮使用冻结主干网络可显著提升 $γ_{\text{ROLE}}$ 和 $γ_{\text{AN-LS}}$ 的结果。
- 该方法在四个多样化的多标签数据集上均表现良好,展现出对领域偏移和不同标签稀疏性的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。