Skip to main content
QUICK REVIEW

[论文解读] On the Use of BERT for Automated Essay Scoring: Joint Learning of Multi-Scale Essay Representation

Yongjie Wang, Chuan Wang|arXiv (Cornell University)|May 8, 2022
Natural Language Processing Techniques被引用 5
一句话总结

本文提出了一种基于 BERT 的多尺度作文表征联合学习框架,整合文档级、句子级和词元级特征,以提升自动作文评分(AES)性能。通过结合多种损失函数(MSE、排序损失、分数分布损失)以及利用域外作文进行 R-Drop 得到的迁移学习,该方法在 ASAP 数据集上达到接近最先进水平的性能(QWK 0.791),并在 CommonLit 可读性奖等长文本任务中展现出良好的泛化能力。

ABSTRACT

In recent years, pre-trained models have become dominant in most natural language processing (NLP) tasks. However, in the area of Automated Essay Scoring (AES), pre-trained models such as BERT have not been properly used to outperform other deep learning models such as LSTM. In this paper, we introduce a novel multi-scale essay representation for BERT that can be jointly learned. We also employ multiple losses and transfer learning from out-of-domain essays to further improve the performance. Experiment results show that our approach derives much benefit from joint learning of multi-scale essay representation and obtains almost the state-of-the-art result among all deep learning models in the ASAP task. Our multi-scale essay representation also generalizes well to CommonLit Readability Prize data set, which suggests that the novel text representation proposed in this paper may be a new and effective choice for long-text tasks.

研究动机与目标

  • 解决尽管 BERT 在其他 NLP 任务中表现优异,但在 AES 中表现不佳的问题。
  • 通过在 BERT 内显式建模多尺度特征(文档、句子、词元),提升作文评分性能。
  • 通过利用域外作文进行迁移学习,缓解 AES 中的数据稀缺问题。
  • 通过受人类评分员行为启发的多损失优化,提升模型的泛化能力和鲁棒性。
  • 证明多尺度表征在长文本评分任务中的有效性。

提出的方法

  • 提出一种多尺度作文表征框架,利用 BERT 同时提取文档级、句子级和词元级特征。
  • 采用联合学习策略,同时在多个尺度上训练模型,增强特征融合。
  • 使用三种损失函数:均方误差(MSE)、排序损失(MR)和分数分布损失(SIM),以更好地匹配人类评分员的行为。
  • 在训练过程中应用 R-Drop 正则化,以提升在有限 AES 数据上的泛化能力并减少过拟合。
  • 通过在目标 AES 数据集上微调前,先在域外作文上进行预训练,实现迁移学习。
  • 采用共享 BERT 编码器,并配合特定任务的分类头,实现多尺度特征提取与回归任务。

实验结果

研究问题

  • RQ1联合学习多尺度作文表征是否能提升 BERT 在自动作文评分中的性能?
  • RQ2结合反映人类评分员行为的多种损失函数,是否能提升模型性能与泛化能力?
  • RQ3通过域外作文进行迁移学习,是否能缓解数据稀缺问题,并提升低资源 AES 环境下的评分准确性?
  • RQ4该多尺度表征框架是否能有效泛化到原始数据集之外的长文本评分任务?
  • RQ5性能提升是源于多尺度建模,还是仅仅得益于长上下文注意力能力?

主要发现

  • 所提出的多尺度 BERT 模型(BERT-DOC-TOK-SEG)在 ASAP 数据集上实现了 0.782 的平均 QWK,显著优于单尺度模型(如 BERT-DOC:0.746,BERT-DOC-TOK:0.771)。
  • 采用多尺度表征的模型(BERT-DOC-TOK-SEG)在 CRP 数据集上实现了 0.607 的 RMSE,表明其在长文本可读性评分任务中具有强大的泛化能力。
  • 通过 R-Drop 的迁移学习使 QWK 从基础模型的 0.782 提升至 0.791(Tran-BERT-MS-ML-R),证明了多损失与正则化的有效性。
  • Longformer-DOC-TOK-SEG 相较于 Longformer-DOC 的显著提升(p < 0.0001)证实,性能增益源于多尺度建模,而非仅依赖长上下文支持。
  • MSE、排序损失(MR)与分数分布损失(SIM)的联合使用,实现了更优的优化过程与更稳健的分数分布,从而提升了集成模型性能。
  • 该模型在训练分布之外的任务中也表现出良好泛化能力,在 CommonLit 可读性奖数据集上取得优异结果,表明其在长文本任务中具有广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。