Skip to main content
QUICK REVIEW

[论文解读] Deep learning for sentence clustering in essay grading support

Li-Hsin Chang, Iiro Rastas|arXiv (Cornell University)|Apr 23, 2021
Topic Modeling参考文献 33被引用 8
一句话总结

本文提出使用基于深度学习的句子嵌入方法对芬兰语本科论文中的语义相似论点进行聚类,旨在支持人工论文评分。在两个经人工标注的芬兰语论文数据集上评估了TF-IDF、LASER、BERT和Sentence-BERT,发现性能因题目类型而异,且最先进模型相比简单词汇方法仅带来微小提升。

ABSTRACT

Essays as a form of assessment test student knowledge on a deeper level than short answer and multiple-choice questions. However, the manual evaluation of essays is time- and labor-consuming. Automatic clustering of essays, or their fragments, prior to manual evaluation presents a possible solution to reducing the effort required in the evaluation process. Such clustering presents numerous challenges due to the variability and ambiguity of natural language. In this paper, we introduce two datasets of undergraduate student essays in Finnish, manually annotated for salient arguments on the sentence level. Using these datasets, we evaluate several deep-learning embedding methods for their suitability to sentence clustering in support of essay grading. We find that the choice of the most suitable method depends on the nature of the exam question and the answers, with deep-learning methods being capable of, but not guaranteeing better performance over simpler methods based on lexical overlap.

研究动机与目标

  • 通过自动聚类学生论文中语义相似的论点,减少论文评分中的手动工作量。
  • 探究基于深度学习的句子嵌入是否优于传统词汇方法(如TF-IDF)以识别论文中的同义论点。
  • 创建并发布两个新的、经人工标注的芬兰语论文数据集,按句子级别标注关键论点,用于论点识别。
  • 评估各种嵌入模型(TF-IDF、LASER、BERT和Sentence-BERT)在支持论文评分的句子级别聚类中的有效性。
  • 探索聚类的实际应用,例如将学生论文与参考答案对齐,以及允许评分者手动调整聚类。

提出的方法

  • 对两组芬兰语大学生论文进行了标注,针对两个不同的考试题目,在句子级别标注了关键论点。
  • 应用了多种嵌入方法:TF-IDF(基于词袋与逆频率)、LASER(多语言句子编码器)、BERT和Sentence-BERT(针对语义相似性微调)。
  • 使用句子嵌入之间的余弦相似度衡量语义相关性,并通过聚类算法(如层次聚类)形成聚类。
  • 使用标准指标(如调整兰德指数(ARI)和F1分数)在标注的论点标签上评估聚类性能。
  • 将该任务视为信息检索(将查询句子与相似句子匹配)和无监督聚类(分组语义等价的句子)。
  • 通过消融研究比较不同类型的考试题目和论点结构下各模型的性能。

实验结果

研究问题

  • RQ1基于深度学习的句子嵌入能否有效聚类语义等价但表达方式不同的学生论文论点?
  • RQ2在论文级论点相似性聚类任务中,最先进的模型(如Sentence-BERT和BERT)与简单方法(如TF-IDF)相比表现如何?
  • RQ3嵌入模型的性能是否取决于考试题目的性质和学生回答的结构?
  • RQ4词汇重叠方法在捕捉同义论点方面,与神经嵌入方法相比,表现是更优还是更差?
  • RQ5生成的聚类在多大程度上可实际用于支持人工评分者,例如识别与参考答案或评分标准的对齐?

主要发现

  • 没有一种深度学习方法在所有情况下均持续优于其他方法;最佳模型的表现因具体考试题目和论点结构而异。
  • 最佳深度学习方法(Sentence-BERT)与TF-IDF基线之间的性能差距相对较小,表明在此设置下复杂模型带来的增益有限。
  • Sentence-BERT在两个数据集上的平均F1分数最高,但相较于TF-IDF的提升微乎其微,且在统计上并不总是显著。
  • 聚类质量对单个句子中论点的连贯性和清晰度高度敏感,多论点句子在准确标注和聚类方面构成挑战。
  • 在论点零散或依赖上下文的论文中,聚类性能较低,因为意义无法在句子层面完整表达。
  • 结果表明,尽管深度学习嵌入能够捕捉语义相似性,但并不能保证其性能优于简单词汇方法,尤其是在特定领域或上下文敏感的写作中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。