[论文解读] Potential Idiomatic Expression (PIE)-English: Corpus for Classes of Idioms
本文介绍了潜在习语表达(PIE)-英语语料库,这是一个大规模、多类别标注的数据集,包含20,174个英语样本和1,197个习语案例,涵盖10种修辞语言类别——隐喻、明喻、委婉语、拟人、矛盾修辞、悖论、夸张、反语、排比和字面意义。该语料库的标注者间一致性达到88.89%,在分类任务中表现优异,BERT模型准确率达到93.4%,F1值达到94.8%,为自然语言处理中基于词元的习语检测研究提供了宝贵资源。
We present a fairly large, Potential Idiomatic Expression (PIE) dataset for Natural Language Processing (NLP) in English. The challenges with NLP systems with regards to tasks such as Machine Translation (MT), word sense disambiguation (WSD) and information retrieval make it imperative to have a labelled idioms dataset with classes such as it is in this work. To the best of the authors' knowledge, this is the first idioms corpus with classes of idioms beyond the literal and the general idioms classification. In particular, the following classes are labelled in the dataset: metaphor, simile, euphemism, parallelism, personification, oxymoron, paradox, hyperbole, irony and literal. We obtain an overall inter-annotator agreement (IAA) score, between two independent annotators, of 88.89%. Many past efforts have been limited in the corpus size and classes of samples but this dataset contains over 20,100 samples with almost 1,200 cases of idioms (with their meanings) from 10 classes (or senses). The corpus may also be extended by researchers to meet specific needs. The corpus has part of speech (PoS) tagging from the NLTK library. Classification experiments performed on the corpus to obtain a baseline and comparison among three common models, including the BERT model, give good results. We also make publicly available the corpus and the relevant codes for working with it for NLP tasks.
研究动机与目标
- 为解决自然语言处理中缺乏大规模、多类别标注习语语料库的问题,特别是超越字面意义和一般习语分类的局限。
- 创建一个高质量、公开可用的语料库,用于训练和评估基于词元的习语检测模型。
- 通过实现细粒度的习语分类,提升机器翻译、词义消歧和信息检索等NLP任务的性能。
- 利用传统模型(mNB、SVM)和最先进的BERT模型,提供基线和对比评估。
- 支持未来将该语料库扩展至特定领域或低资源NLP应用。
提出的方法
- 该语料库主要来源于英国国家语料库(96.9%)和英国网页语料库(3.1%),并人工标注了10种修辞语言类别。
- 两名独立标注者之间的标注者间一致性达到88.89%,确保了标签的高质量。
- 使用NLTK库进行词性标注,为语料库增添了语言学特征。
- 采用分层的85:15训练-验证集划分策略,以缓解数据集中的类别不平衡问题。
- 训练并评估了三种模型——多项式朴素贝叶斯(mNB)、线性支持向量机(SVM)和BERT,用于基线比较。
- 模型训练前的预处理包括大小写标准化、HTML标签移除以及符号和数字过滤。
实验结果
研究问题
- RQ1能否构建一个大规模、多类别标注的习语语料库,实现超越字面意义和一般习语分类的细粒度分类?
- RQ2在真实自然语言处理场景下,针对多样化的修辞语言类别,标注者间一致性表现如何?
- RQ3标准模型和最先进模型在将习语分类到10个不同修辞语言类别中的性能如何?
- RQ4类别不平衡在多大程度上影响模型性能?是否可通过数据增强或模型设计加以缓解?
- RQ5PIE-English语料库能否作为未来基于词元的习语检测和修辞语言理解研究的可靠基线?
主要发现
- PIE-English语料库包含20,174个样本和1,197个不同的习语案例,涵盖10种修辞语言类别,其中隐喻最为常见(14,666个样本)。
- 标注者间一致性得分为88.89%,表明标注过程具有高度的一致性和可靠性。
- BERT模型表现最佳,准确率达到93.4%,F1值达到94.8%,显著优于mNB(74.7%准确率)和SVM(76.6%准确率)。
- 模型在明喻(99.6%准确率)和隐喻(97.5%准确率)上接近完美表现,而夸张、矛盾修辞和反语因训练样本极少,表现极差。
- 错误分析显示,隐喻常被误分类为字面意义或委婉语,而委婉语也常与隐喻混淆,这可能是由于训练数据中隐喻占主导地位所致。
- 该语料库已公开提供代码,支持未来在特定NLP任务中的扩展与适配,尤其适用于低资源或领域特定场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。