[论文解读] Short-answer scoring with ensembles of pretrained language models
本文研究了基于预训练变换器的语言模型集成在Kaggle ASAS数据集上的自动短答案评分表现。尽管单个大型模型的表现不及最先进的基于规则的方法,但表现最佳的大型模型(如RoBERTa-large、Electra-large)的集成在性能上达到了最先进水平,尽管计算成本极高,凸显了在实际部署场景中准确率与可部署性之间的权衡。
We investigate the effectiveness of ensembles of pretrained transformer-based language models on short answer questions using the Kaggle Automated Short Answer Scoring dataset. We fine-tune a collection of popular small, base, and large pretrained transformer-based language models, and train one feature-base model on the dataset with the aim of testing ensembles of these models. We used an early stopping mechanism and hyperparameter optimization in training. We observe that generally that the larger models perform slightly better, however, they still fall short of state-of-the-art results one their own. Once we consider ensembles of models, there are ensembles of a number of large networks that do produce state-of-the-art results, however, these ensembles are too large to realistically be put in a production environment.
研究动机与目标
- 评估基于预训练变换器的语言模型在Kaggle ASAS数据集上的短答案评分任务中的有效性。
- 确定这些模型的集成是否能在性能上超越现有的基于规则的基线方法。
- 评估在实际教育评估系统中部署此类模型的可行性。
- 识别在ASAS基准上表现最优的模型架构与集成配置。
- 探索高性能模型与实际部署约束之间的差距。
提出的方法
- 在KSAS数据集上微调了多种小型、基础型和大型预训练变换器模型,包括BERT、RoBERTa、Electra、DeBERTa和DistilBERT。
- 训练过程中应用早停法和超参数优化,以提升泛化能力和收敛性。
- 训练了一个独立的基于特征的模型,使用基于规则的特征,以与神经网络性能进行对比。
- 通过平均或投票策略,将表现最佳的单个模型的预测结果组合,构建模型集成。
- 使用标准NLP指标评估模型,包括Cohen's二次加权 kappa(QWK)和标准化均值差异(SMD)。
- 使用GLUE基准作为模型容量和泛化潜力的代理,以指导模型选择。
实验结果
研究问题
- RQ1大型预训练语言模型的集成是否能在Kaggle自动短答案评分数据集上超越最先进的基于规则的方法?
- RQ2模型规模和架构(如RoBERTa、Electra、BERT)如何影响短答案评分任务的性能?
- RQ3单个预训练模型在多大程度上超越了基于规则的系统,以及在哪些提示(prompt)上表现不佳?
- RQ4实现最先进性能的集成计算成本是多少,是否适合在生产环境中部署?
- RQ5结合特征工程与深度学习是否能实现超越纯神经网络集成的性能提升?
主要发现
- 表现最佳的三个大型模型(如RoBERTa-large、Electra-large、DeBERTa-base)的集成在测试集上实现了最先进性能,QWK和SMD指标均超过[10]的基准。
- 表现最佳的单个模型是RoBERTa-large,其次是Electra-large和Electra-base,但其性能排序在验证集和测试集之间存在差异。
- 尽管在单个提示上表现强劲,但没有任何一个预训练模型在所有提示上均超越[10]的基于规则基线,尤其在提示10上表现较差。
- 最佳三个模型的集成在验证集上实现了0.936的QWK和0.047的SMD,表明其与人工评分高度一致。
- 即使是最高效的测试模型(如DistilBERT、MobileBERT)也表现不如最佳集成,表明性能提升源于模型容量和多样性。
- 最佳集成的计算成本(约8.75亿参数)使其在实时或资源受限的生产环境中难以实用化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。