[论文解读] Pseudo-Labeled Auto-Curriculum Learning for Semi-Supervised Keypoint Localization
本文提出伪标签自动课程学习(PLACL),一种基于强化学习的方法,可自动学习动态置信度阈值,以在半监督关键点定位中选择高质量的伪标签样本。通过将课程设计建模为决策问题,并利用交叉训练缓解确认偏误,PLACL 在仅使用 5% 标注数据的情况下,在六个基准数据集上实现了最先进性能。
Localizing keypoints of an object is a basic visual problem. However, supervised learning of a keypoint localization network often requires a large amount of data, which is expensive and time-consuming to obtain. To remedy this, there is an ever-growing interest in semi-supervised learning (SSL), which leverages a small set of labeled data along with a large set of unlabeled data. Among these SSL approaches, pseudo-labeling (PL) is one of the most popular. PL approaches apply pseudo-labels to unlabeled data, and then train the model with a combination of the labeled and pseudo-labeled data iteratively. The key to the success of PL is the selection of high-quality pseudo-labeled samples. Previous works mostly select training samples by manually setting a single confidence threshold. We propose to automatically select reliable pseudo-labeled samples with a series of dynamic thresholds, which constitutes a learning curriculum. Extensive experiments on six keypoint localization benchmark datasets demonstrate that the proposed approach significantly outperforms the previous state-of-the-art SSL approaches.
研究动机与目标
- 解决半监督关键点定位中不可靠伪标签选择的挑战,其中固定置信度阈值会导致次优性能。
- 通过引入一种在不相交子数据集间交替训练的交叉训练策略,克服迭代伪标签过程中确认偏误和噪声累积的问题。
- 开发一种自动化的、数据驱动的课程学习框架,根据模型反馈动态调整阈值选择,消除手动调参的需要。
- 提升半监督关键点定位在多样化数据集和网络架构下的泛化能力与鲁棒性。
提出的方法
- 将课程设计形式化为序列决策问题,模型通过强化学习(PPO2)学习选择伪标签的最优置信度阈值。
- 使用强化学习智能体根据模型性能反馈,在训练轮次中动态调整阈值,实现从简单样本到复杂样本的渐进式课程演化。
- 实施一种交叉训练策略,在独立的子数据集上交替进行伪标签预测与模型训练,以减少噪声累积和确认偏误。
- 将基于强化学习的课程学习与标准伪标签方法集成,使该方法具备模型无关性,可适用于多种关键点定位网络。
- 采用 PPO2 的搜索范式,高效探索可能的阈值序列空间,优于随机或人工搜索。
- 将课程定义为一系列置信度阈值,这些阈值根据模型预测质量与泛化性能进行迭代更新。
实验结果
研究问题
- RQ1能否通过自动学习的动态置信度阈值课程,在半监督关键点定位中超越固定的手动设定阈值?
- RQ2交叉训练在迭代伪标签过程中如何缓解确认偏误与噪声累积?
- RQ3与随机或人工选择阈值相比,基于强化学习的课程搜索在性能提升方面有多大优势?
- RQ4所提出方法在不同关键点定位数据集和网络架构上的泛化能力如何?
主要发现
- 在 LSPET 数据集上,仅使用 5% 标注数据,PLACL 的 PCK@0.1 得分为 70.76,显著优于之前最先进方法(WS-CDA+PPLO)的 4.4 分。
- 在 MS-COCO 数据集上,使用 5% 标注数据,PLACL 的 PCK@0.1 达到 66.0,领先于次优方法(WS-CDA+PPLO)12.9 分。
- 消融实验表明,若移除交叉训练策略,性能从 70.76 降至 67.13 的 PCK@0.1,证明其在缓解噪声累积方面具有关键作用。
- 通过强化学习实现的动态阈值(PLACL)相比固定阈值基线,性能提升 3.2 分,验证了课程学习的有效性。
- PLACL 超越了采用递减阈值的专家设计课程,表明自动化的强化学习课程学习比人工设计的启发式方法更有效。
- 该方法具备模型无关性与良好泛化能力,在六个多样化数据集上均取得一致性能提升,涵盖人体与动物姿态估计基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。