[论文解读] Language Modeling by Clustering with Word Embeddings for Text Readability Assessment
本文提出一种基于聚类的语言模型,利用词嵌入改进文本可读性预测。通过将预训练的fastText词向量应用K-means聚类,并将文档表示为直方图特征,该方法在Common Core Standards语料库上实现了0.83的斯皮尔曼等级相关系数和0.82的皮尔逊相关系数,达到当前最优性能,优于先前使用浅层特征或标准嵌入的方法。
We present a clustering-based language model using word embeddings for text readability prediction. Presumably, an Euclidean semantic space hypothesis holds true for word embeddings whose training is done by observing word co-occurrences. We argue that clustering with word embeddings in the metric space should yield feature representations in a higher semantic space appropriate for text regression. Also, by representing features in terms of histograms, our approach can naturally address documents of varying lengths. An empirical evaluation using the Common Core Standards corpus reveals that the features formed on our clustering-based language model significantly improve the previously known results for the same corpus in readability prediction. We also evaluate the task of sentence matching based on semantic relatedness using the Wiki-SimpleWiki corpus and find that our features lead to superior matching performance.
研究动机与目标
- 通过利用词嵌入中的语义特征而非依赖浅层语言学特征,改进文本可读性评估。
- 探究在语义空间中对词向量进行聚类是否能为文本回归任务生成更具区分性的特征。
- 评估所提方法在可读性预测和句子匹配(语义相似性)任务中的有效性。
- 证明基于直方图的聚类词嵌入表示可自然处理可变长度文档。
提出的方法
- 该方法使用在Common Core Standards语料库上训练的fastText词嵌入,将词语表示在高维语义空间中。
- 对词向量应用K-means聚类,将语义相似的词语分组为簇,形成基于簇的语言模型。
- 通过统计每篇文档中各簇的出现次数,构建文档级特征,形成可容纳可变长度文本的直方图表示。
- 将直方图特征作为回归模型的输入,用于预测文本可读性等级。
- 对于句子匹配任务,通过平均句子中词嵌入生成句子嵌入,并通过最近邻搜索评估语义相似性。
- 该方法在两个基准数据集上进行评估:用于可读性预测的Common Core Standards语料库和用于语义句子匹配的Wiki-SimpleWiki语料库。
实验结果
研究问题
- RQ1在语义空间中对词嵌入进行聚类,是否能为文本可读性预测提供优于传统浅层特征或原始嵌入的特征?
- RQ2簇频率的直方图表示是否能提升在可变长度文档上的可读性评估性能?
- RQ3所提出的基于聚类的语言模型能否有效捕捉词汇和语法不同的句子之间的语义相似性?
- RQ4该方法在Common Core Standards语料库上的性能与当前最优方法相比如何?
主要发现
- 所提方法在Common Core Standards语料库上实现了0.83的斯皮尔曼等级相关系数和0.82的皮尔逊相关系数,优于先前的SOTA结果。
- 对fastText词向量进行K-means聚类的表现优于Brown聚类和基线嵌入模型,且在词向量于目标语料库上微调后性能最佳。
- 该方法使维基百科句子与其SimpleWiki对应句在语义空间中处于最近邻的前4名的概率达到95.9%,表明语义保留能力出色。
- 使用fastText嵌入结合K-means聚类显著优于词袋模型、word2vec和doc2vec基线模型,在可读性预测任务中表现更优。
- 基于直方图的特征表示有效处理了不同长度的文档,实现了在各种文本长度下的稳健性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。