[论文解读] PiCO+: Contrastive Label Disambiguation for Robust Partial Label Learning
本文提出 PiCO+,一种用于鲁棒部分标签学习的对比学习框架,通过类别原型联合优化表示学习与标签消歧。通过利用分类器输出中的伪正样本对并迭代优化原型,PiCO+ 在标准和噪声部分标签基准上实现了最先进性能,即使在标签模糊的情况下也能达到全监督学习的准确率。
Partial label learning (PLL) is an important problem that allows each training example to be labeled with a coarse candidate set, which well suits many real-world data annotation scenarios with label ambiguity. Despite the promise, the performance of PLL often lags behind the supervised counterpart. In this work, we bridge the gap by addressing two key research challenges in PLL -- representation learning and label disambiguation -- in one coherent framework. Specifically, our proposed framework PiCO consists of a contrastive learning module along with a novel class prototype-based label disambiguation algorithm. PiCO produces closely aligned representations for examples from the same classes and facilitates label disambiguation. Theoretically, we show that these two components are mutually beneficial, and can be rigorously justified from an expectation-maximization (EM) algorithm perspective. Moreover, we study a challenging yet practical noisy partial label learning setup, where the ground-truth may not be included in the candidate set. To remedy this problem, we present an extension PiCO+ that performs distance-based clean sample selection and learns robust classifiers by a semi-supervised contrastive learning algorithm. Extensive experiments demonstrate that our proposed methods significantly outperform the current state-of-the-art approaches in standard and noisy PLL tasks and even achieve comparable results to fully supervised learning.
研究动机与目标
- 解决部分标签学习(PLL)中表示学习与标签消歧之间的相互依赖问题,该问题常因标签模糊而降低性能。
- 克服现有 PLL 方法依赖劣质表示的局限性,从而导致标签消歧不准确。
- 开发一个统一框架,协同提升表示质量与标签消歧准确性。
- 将框架扩展至处理噪声部分标签学习,其中真实标签可能被排除在候选集之外——这是一个现实但研究不足的挑战。
- 从期望最大化(EM)视角对框架进行理论证明,表明对比学习与基于原型的消歧之间存在相互促进的关系。
提出的方法
- 引入一个对比学习模块,从分类器输出中生成伪正样本对,以改善部分标签设置下的特征表示学习。
- 提出一种基于原型的标签消歧策略,将每个样本分配给与之最近的原型类别,并通过迭代方式优化伪标签。
- 在类似 EM 的优化循环中交替执行对比学习(M 步)与标签消歧(E 步),以联合优化表示与预测。
- 理论上将学习到的表示建模为单位超球面上的 von Mises-Fisher(vMF)分布混合模型,从而通过特定分量标签实现合理的标签分配。
- 通过引入基于距离的可靠样本选择标准,将 PiCO 扩展为 PiCO+,以在噪声部分标签设置中识别可靠样本。
- 在 PiCO+ 中集成半监督对比学习,通过利用所选可靠样本中的未标记数据进一步提升鲁棒性。
实验结果
研究问题
- RQ1对比学习能否被有效适配到部分标签学习中,以提升表示质量与标签消歧性能?
- RQ2如何将基于原型的消歧与对比学习结合,构建一个协同优化的训练框架?
- RQ3当真实标签被排除在候选集之外时(这是现实世界中的常见问题),所提出的框架能否保持高性能?
- RQ4在已知的统计框架下,表示与消歧的联合优化是否具有理论合理性?
- RQ5通过引入可靠样本选择与半监督学习,该框架能否推广至噪声部分标签学习?
主要发现
- PiCO+ 在三个标准部分标签学习基准上实现了最先进性能,显著优于现有最先进方法。
- 在噪声部分标签学习基准上,PiCO+ 展现出良好的鲁棒性与泛化能力,即使真实标签被排除在候选集之外。
- 该方法的性能可与全监督学习相媲美,表明通过联合表示学习与消歧学习,可有效缓解标签模糊问题。
- 理论分析证实,该框架与 EM 算法一致:对比学习提升表示质量,而消歧则通过迭代优化伪标签,形成相互促进的循环。
- PiCO+ 中采用基于距离的可靠样本选择方法,在噪声环境下显著提升了鲁棒性,优于标准的小损失选择准则。
- 所学表示被证明符合 von Mises-Fisher 分布的混合模型,为基于原型的标签分配提供了几何解释。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。