[论文解读] Fine-Tuning Language Models via Epistemic Neural Networks
本文提出通过引入一个epinet——一个小型辅助网络,用于估计认知不确定性,从而在微调过程中优先选择信息量大的训练样本,以增强类似BERT的大语言模型。通过使用基于不确定性的主动学习方法,该方法在仅使用标准微调所需一半标注样本的情况下,实现了BERT在GLUE基准上的全部性能,同时提升了最终准确率。
Language models often pre-train on large unsupervised text corpora, then fine-tune on additional task-specific data. However, typical fine-tuning schemes do not prioritize the examples that they tune on. We show that, if you can prioritize informative training data, you can achieve better performance while using fewer labels. To do this we augment a language model with an epinet: a small additional network that helps to estimate model uncertainty and forms an extit{epistemic neural network} (ENN). ENNs are neural networks that can know what they don't know. Using an epinet to prioritize uncertain data, we can fine-tune BERT on GLUE tasks to the same performance while using 2x less data than training without prioritization. We also investigate performance in synthetic neural network generative models designed to build understanding. In each setting, using an epinet outperforms heuristic active learning schemes.
研究动机与目标
- 通过优先选择信息量大的训练样本,提升大语言模型微调的数据效率。
- 解决标准微调方法的局限性,即对所有训练数据一视同仁,未考虑不确定性。
- 通过可学习的epinet估计认知不确定性,使语言模型能够‘知道自己不知道什么’。
- 证明基于认知不确定性的优先选择优于熵或置信度间隔等启发式主动学习方法。
- 展示epinet增强的模型在最终性能和数据需求方面均优于基线微调方法。
提出的方法
- 在基础语言模型训练的同时,训练一个epinet以估计认知不确定性,从而将其与偶然不确定性区分开来。
- epinet使用方差或BALD(基于分歧的贝叶斯主动学习)作为不确定性度量,以优先选择不确定且信息量大的样本。
- 在微调过程中,模型根据认知不确定性选择训练数据,重点关注模型最不自信的样本。
- epinet通过结合蒙特卡洛丢弃和模型集成的方法进行训练,以提升不确定性估计的准确性。
- 该方法应用于BERT在GLUE基准任务上的实验,并在合成神经网络生成模型(Neural Testbed)上进行了验证。
- 性能通过数据效率进行评估——即达到基线性能所需标签数量的几何平均值。
实验结果
研究问题
- RQ1通过epinet进行认知不确定性估计,能否提升大语言模型微调的数据效率?
- RQ2使用认知不确定性优先选择不确定样本,是否能在更少标签下实现优于启发式主动学习方法(如熵或置信度间隔选择)的性能?
- RQ3与基于集成或丢弃的不确定性估计相比,epinet在数据效率和计算成本方面表现如何?
- RQ4认知优先选择是否不仅能提升样本效率,还能提升最终模型的准确率?
- RQ5epinet的优势源于不确定性估计本身,还是仅仅因为增加了网络容量?
主要发现
- 在GLUE基准任务上,使用认知优先策略微调BERT,仅需标准微调一半的标注样本即可达到相同的性能。
- 即使使用更少的数据,基于epinet的方法仍能将最终模型准确率提升至基线以上。
- 认知优先策略优于熵或置信度间隔等启发式方法,后者在MNLI等任务上无法达到基线性能。
- 使用epinet但采用均匀采样选择数据的性能显著低于认知优先策略,证明其优势源于不确定性驱动的选择,而非网络架构本身。
- 基于集成和丢弃的不确定性估计也能提升数据效率,但其计算成本高于轻量级epinet。
- 选择方差或BALD作为不确定性度量的影响极小,两者均带来相似的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。