[论文解读] SemiReward: A General Reward Model for Semi-supervised Learning
SemiReward 提出了一种通用、可插拔的奖励模型,通过预测奖励分数来评估和过滤半监督学习中的高质量伪标签,采用两阶段训练流程,结合生成器与奖励网络以缓解确认偏见。该方法在涵盖视觉、自然语言处理和语音任务的13个多样化SSL基准上实现了显著的性能提升和更快的收敛速度,优于Pseudo Label、FlexMatch和Free/SoftMatch等SOTA方法。
Semi-supervised learning (SSL) has witnessed great progress with various improvements in the self-training framework with pseudo labeling. The main challenge is how to distinguish high-quality pseudo labels against the confirmation bias. However, existing pseudo-label selection strategies are limited to pre-defined schemes or complex hand-crafted policies specially designed for classification, failing to achieve high-quality labels, fast convergence, and task versatility simultaneously. To these ends, we propose a Semi-supervised Reward framework (SemiReward) that predicts reward scores to evaluate and filter out high-quality pseudo labels, which is pluggable to mainstream SSL methods in wide task types and scenarios. To mitigate confirmation bias, SemiReward is trained online in two stages with a generator model and subsampling strategy. With classification and regression tasks on 13 standard SSL benchmarks across three modalities, extensive experiments verify that SemiReward achieves significant performance gains and faster convergence speeds upon Pseudo Label, FlexMatch, and Free/SoftMatch. Code and models are available at https://github.com/Westlake-AI/SemiReward.
研究动机与目标
- 解决由低质量伪标签引起的半监督学习中的确认偏见问题。
- 开发一种通用、与任务无关的方法,用于选择高质量的伪标签,而无需依赖手工设计或特定任务的策略。
- 在分类和回归任务中,实现跨多种模态和任务的快速收敛与一致的性能提升。
- 设计一种轻量级、可插拔的框架,可无缝集成到现有SSL方法中。
- 通过两阶段流水线和生成器网络,在线训练奖励模型,计算开销极低。
提出的方法
- 训练一个奖励网络,基于伪标签与真实标签之间的余弦相似度,预测平滑且校准良好的奖励分数。
- 奖励网络采用两阶段训练:首先在标注数据上使用生成器生成‘假标签’进行预训练,然后在子采样的标注数据和选定的未标注数据上进行微调。
- 在预训练阶段,生成器网络生成合成伪标签,以将奖励网络训练与学生模型解耦,降低确认偏见。
- 使用回归损失训练奖励网络以预测真实奖励分数,确保标签过滤的校准性和可靠性。
- 该框架即插即用,兼容主流SSL方法,如Pseudo Label、FlexMatch和Free/SoftMatch。
- 在第二阶段采用子采样策略,在保持高采样率的同时,基于预测的奖励分数过滤低质量伪标签。
实验结果
研究问题
- RQ1基于伪标签与真实标签之间余弦相似度的可学习奖励分数,能否作为分类和回归任务中伪标签质量的可靠、通用度量?
- RQ2如何在在线训练中以极低计算成本训练奖励模型,同时避免自训练SSL中的确认偏见?
- RQ3可插拔的奖励模块在多样化SSL基准和模态中,能在多大程度上提升性能和收敛速度?
- RQ4结合生成器与奖励网络的两阶段训练流水线,能否有效将奖励网络训练与学生模型解耦并提升泛化能力?
- RQ5奖励网络能否在无需任务特定调整的情况下,跨不同SSL算法和数据集实现良好泛化?
主要发现
- 在涵盖视觉、自然语言处理和语音模态的13个标准SSL基准上,SemiReward相较于基线SSL方法实现了+1.9%至+3.7%的准确率提升。
- 与基线相比,SemiReward将达到峰值性能所需的训练迭代次数减少了至少1.7倍,表明收敛速度显著加快。
- 在计算机视觉、自然语言处理和语音数据集上,SemiReward在分类和回归任务中均持续提升了SOTA方法(如Pseudo Label、FlexMatch和Free/SoftMatch)的性能。
- 通过实证分析验证,SemiReward预测的奖励分数具有良好的校准性,能可靠识别高质量伪标签。
- 结合生成器的两阶段训练流水线有效缓解了确认偏见,实现了稳定且准确的奖励模型训练。
- 该框架具有高度泛化能力,在无需架构或超参数调整的情况下,可在多样化数据集和任务类型中实现一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。