[论文解读] BayesFormer: Transformer with Uncertainty Estimation
BayesFormer 通过使用新颖的dropout机制进行近似变分推断,提出了一种理论基础扎实的Transformer模型不确定性估计方法。通过在注意力和前馈网络层中应用带有贝叶斯正则化的dropout,该方法提升了预测不确定性校准效果,减少了过拟合,并在自然语言处理任务中(包括主动学习和长上下文建模)显著提升了性能。
Transformer has become ubiquitous due to its dominant performance in various NLP and image processing tasks. However, it lacks understanding of how to generate mathematically grounded uncertainty estimates for transformer architectures. Models equipped with such uncertainty estimates can typically improve predictive performance, make networks robust, avoid over-fitting and used as acquisition function in active learning. In this paper, we introduce BayesFormer, a Transformer model with dropouts designed by Bayesian theory. We proposed a new theoretical framework to extend the approximate variational inference-based dropout to Transformer-based architectures. Through extensive experiments, we validate the proposed architecture in four paradigms and show improvements across the board: language modeling and classification, long-sequence understanding, machine translation and acquisition function for active learning.
研究动机与目标
- 解决Transformer模型中缺乏数学上严谨的不确定性量化问题,尤其是在小样本或高风险场景下。
- 提升模型鲁棒性,减少过拟合,并增强在实际部署中对预测置信度估计的可靠性。
- 通过提供更准确的不确定性估计,实现更优的主动学习性能,以支持样本选择。
- 为Transformer架构量身定制一种理论依据充分的基于dropout的不确定性估计框架。
- 在多种自然语言处理范式中实现泛化能力,包括微调、长上下文理解以及机器翻译。
提出的方法
- 应用近似变分推断,推导出Transformer权重的后验分布,采用高斯先验分布对权重进行建模。
- 提出一种新型dropout结构,将dropout同时应用于注意力和前馈子层,每个子层设置独立的dropout率0.05。
- 使用蒙特卡洛dropout(MCDropout)进行11次前向传播,通过BALD采集函数估计预测不确定性与认知不确定性。
- 采用证据下界(ELBO)目标函数进行训练,最小化近似后验分布与真实后验分布之间的KL散度。
- 在保持标准Transformer架构不变的前提下,仅在注意力和前馈网络层中引入贝叶斯dropout,不改变原有dropout率。
- 训练过程中使用标签平滑和LabelSmoothedCrossEntropyCriterion,以提升泛化能力和不确定性校准效果。
实验结果
研究问题
- RQ1近似变分推断能否被有效扩展至Transformer架构,以提供数学上严谨的不确定性估计?
- RQ2与标准RoBERTa模型中的标准MCDropout相比,所提出的BayesFormer dropout机制在不确定性校准方面有何改进?
- RQ3BayesFormer的不确定性估计是否能显著提升主动学习性能,特别是在低标签预算条件下?
- RQ4与标准RoBERTa相比,BayesFormer在小数据集微调过程中对过拟合的抑制程度如何?
- RQ5BayesFormer的不确定性估计能否在包括序列建模、机器翻译和零样本迁移在内的多样化NLP任务中实现良好泛化?
主要发现
- 在CoLA开发集上,BayesFormer取得32.1的MCC得分,显著优于RoBERTa base(21.3),表明其泛化能力和不确定性校准性能更优。
- 在GLUE基准测试中,BayesFormer在SST-2上达到91.3%的准确率,MRPC上F1得分为90.9%,MNLI上准确率为83.3%,在多个任务中超越RoBERTa base。
- 在主动学习中,当仅使用10%的数据时,BayesFormer在开发集上取得62.8的MCC得分,较RoBERTa高出4分,较随机采样高出3.6分。
- 通过丢弃部分标注数据,模型性能达到最佳,表明BayesFormer的不确定性估计有助于避免对噪声或模糊样本的过拟合。
- 在机器翻译任务中,BayesFormer相比基线Transformer模型将测试BLEU分数提升了0.5–1.0个点,且验证BLEU分数更高,表明泛化能力更强。
- 在所有评估任务中,包括长上下文理解与少样本学习,模型均保持性能优势,且无需对除新dropout率外的其他超参数进行额外调优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。