[论文解读] Self-training with Few-shot Rationalization: Teacher Explanations Aid Student in Few-shot NLU
该论文提出了一种多任务自训练框架,通过在有限标注数据下联合学习预测任务标签和生成推理过程,从而提升少样本自然语言理解性能。通过引入教师模型生成的伪标签,并结合基于置信度的重加权机制,以及强制推理过程具备充分性、完整性和简洁性的损失函数,该方法在低资源设置下显著提升了模型性能与可解释性。
While pre-trained language models have obtained state-of-the-art performance for several natural language understanding tasks, they are quite opaque in terms of their decision-making process. While some recent works focus on rationalizing neural predictions by highlighting salient concepts in the text as justifications or rationales, they rely on thousands of labeled training examples for both task labels as well as an-notated rationales for every instance. Such extensive large-scale annotations are infeasible to obtain for many tasks. To this end, we develop a multi-task teacher-student framework based on self-training language models with limited task-specific labels and rationales, and judicious sample selection to learn from informative pseudo-labeled examples1. We study several characteristics of what constitutes a good rationale and demonstrate that the neural model performance can be significantly improved by making it aware of its rationalized predictions, particularly in low-resource settings. Extensive experiments in several bench-mark datasets demonstrate the effectiveness of our approach.
研究动机与目标
- 解决在无法获取大规模标注推理过程的低资源自然语言理解挑战。
- 通过在最小监督下联合训练任务标签与推理预测,提升模型性能与可解释性。
- 开发一种自训练框架,利用教师模型生成的伪标签推理过程,提升学生模型的泛化能力。
- 通过定制化的损失函数,强制实现推理过程的关键特性:充分性、完整性和连贯性,以确保高质量推理。
提出的方法
- 采用多任务学习设置,使学生模型同时预测任务标签并从输入文本中提取推理过程。
- 在少量标注样本上训练教师模型,并在每次自训练迭代中为未标注数据生成伪标签。
- 在样本和词元层面应用基于置信度的重加权机制,以提升信息量高的伪标签样本权重,降低噪声样本的权重。
- 通过三种损失组件强制提升推理质量:充分性(比较学生模型在推理与完整输入上的预测一致性)、完整性(在掩码推理时最大化熵)、稀疏性(鼓励生成简洁的推理)。
- 基于推理模块的验证损失执行早停策略,以防止噪声伪标签导致的错误传播。
- 在每次迭代中对教师模型进行微调,以防止分布漂移,保持其与原始任务的一致性。
实验结果
研究问题
- RQ1在少样本推理设置下,结合自训练是否能提升低资源环境中的下游自然语言理解性能?
- RQ2高质量推理过程的特征是什么?这些特征如何在神经网络模型中有效建模?
- RQ3与解耦方法相比,联合训练任务预测与推理提取的多任务学习方法有何优势?
- RQ4基于置信度的伪标签样本重加权在多大程度上提升了模型的鲁棒性与性能?
- RQ5不同损失组件(充分性、完整性、稀疏性)如何影响推理生成的质量与稳定性?
主要发现
- 所提出的多任务自训练框架在ERASER基准的五个数据集上,显著提升了下游任务准确率与推理质量。
- 基于置信度的伪标签样本重加权带来了性能增益,尤其在Movies数据集上表现明显,但效果随推理覆盖度变化而异。
- 完整性损失有效缓解了稀疏性损失带来的不稳定性,提升了训练收敛性与推理一致性。
- 模型在12至15次自训练迭代内收敛,但约10轮后推理提取质量因错误传播而下降,因此需要早停策略。
- 消融实验证实,充分性、完整性与稀疏性三种损失组件均对生成简洁、准确且上下文恰当的推理至关重要。
- 该框架在少样本设置下优于当前最先进方法,表明让模型意识到自身推理过程可显著提升性能,即使在高资源场景下亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。