[论文解读] CompLex: A New Corpus for Lexical Complexity Prediction from Likert Scale Data
CompLex 提供首个用于连续词汇复杂度预测的英语语料库,使用5点李克特量表,覆盖圣经、欧洲议会文本和生物医学文本,基线预测显示有希望的MAE结果。
Predicting which words are considered hard to understand for a given target population is a vital step in many NLP applications such as text simplification. This task is commonly referred to as Complex Word Identification (CWI). With a few exceptions, previous studies have approached the task as a binary classification task in which systems predict a complexity value (complex vs. non-complex) for a set of target words in a text. This choice is motivated by the fact that all CWI datasets compiled so far have been annotated using a binary annotation scheme. Our paper addresses this limitation by presenting the first English dataset for continuous lexical complexity prediction. We use a 5-point Likert scale scheme to annotate complex words in texts from three sources/domains: the Bible, Europarl, and biomedical texts. This resulted in a corpus of 9,476 sentences each annotated by around 7 annotators.
研究动机与目标
- 将词汇复杂度预测作为连续任务而非二元分类的动机。
- 创建一个带有Likert量表复杂度分数的多样化英语语料库。
- 分析注释质量和跨体裁的词汇复杂度差异。
- 提供基线预测模型以确立连续复杂度预测的可行性。
提出的方法
- 为词汇复杂度开发一个5点李克特量表注释方案(1=Very Easy 到 5=Very Difficult)。
- 从圣经、欧洲议会和生物医学领域收集9,476个句子并使用众包对目标(单词和MWEs)进行注释。
- 将注释汇总成归一化的0–1复杂度分数(1->0, 2->0.25, 3->0.5, 4->0.75, 5->1)。
- 每个实例使用20次注释,设质量控制,且丢弃参与不足的注释(保留至少4个有效注释)。
- 使用混合特征训练基线线性回归:300维GloVe词向量、4,096维InferSent上下文嵌入,以及手工特征(频率、长度、音节数)。
- 在保留集的10%测试集上评估并报告平均绝对误差(MAE)。
实验结果
研究问题
- RQ1词汇复杂度是否能有效建模为连续属性而非二元标签?
- RQ2不同领域体裁(圣经、欧洲议会、生物医学)在词汇复杂度和模型可建模性方面有何差异?
- RQ3在LCP中,单词级嵌入相比上下文嵌入与手工特征的预测价值如何?
- RQ4多词表达式(MWEs)在不同领域的复杂度是否与单词不同?
- RQ5使用标准词汇特征和嵌入,线性模型在CompLex上的基线性能可以达到何种水平?
主要发现
- 该语料包含9,476个句子,平均复杂度约为0.395(标准差0.115)。
- 单词平均复杂度为0.385,MWEs平均0.444,存在领域差异(生物医学更高的复杂度)。
- 使用手工特征的基线线性回归在最佳设定下的MAE为0.0853。
- 仅词嵌入的MAE为0.0875,与手工特征相当;句子嵌入预测性较差(MAE未改进)。
- 在某些配置下,Europarl的MAE通常低于Bible的0.6648和Biomed的0.2954,表明领域特定可预测性。
- 上下文嵌入在此基线设置中并未持续改善预测,表明采用替代模型可能带来改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。