[论文解读] Corpus-Guided Contrast Sets for Morphosyntactic Feature Detection in Low-Resource English Varieties
本文提出一种基于语料库引导的人工参与方法,用于生成形态句法对比训练集,以提升对低资源英语变体中语言特征的自动检测能力。通过利用语料驱动的编辑和专家筛选,该方法在印度英语和非洲裔美国人英语上的Prec@100得分相比先前方法最高提升16个百分点,显示出更高的准确性和社会语言学有效性,同时发布了可复用的模型和数据。
The study of language variation examines how language varies between and within different groups of speakers, shedding light on how we use language to construct identities and how social contexts affect language use. A common method is to identify instances of a certain linguistic feature - say, the zero copula construction - in a corpus, and analyze the feature's distribution across speakers, topics, and other variables, to either gain a qualitative understanding of the feature's function or systematically measure variation. In this paper, we explore the challenging task of automatic morphosyntactic feature detection in low-resource English varieties. We present a human-in-the-loop approach to generate and filter effective contrast sets via corpus-guided edits. We show that our approach improves feature detection for both Indian English and African American English, demonstrate how it can assist linguistic research, and release our fine-tuned models for use by other researchers.
研究动机与目标
- 为解决低资源英语变体(如印度英语和非洲裔美国人英语)中自动形态句法特征检测的挑战,此类变体的人工标注成本高且数据稀缺。
- 通过生成在语言上具有意义且形态句法上相似的对比集,提升特征检测训练数据的质量和多样性。
- 通过定量性能指标和与年龄、性别及地域差异的社会语言学发现的一致性,验证该方法的有效性。
- 发布针对印度英语的10项特征和非洲裔美国人英语的17项特征的微调模型及精选训练数据,以支持未来研究。
提出的方法
- 该方法通过语料库引导的编辑系统生成对比集,即对种子集中的正例进行修改,生成语义和句法上相似的负例。
- 人工标注者对生成的对比集进行筛选和优化,以确保语言上的合理性及形态句法上的对比性。
- 在筛选后的对比集上对预训练语言模型进行微调,以实现对话语层面形态句法特征的分类。
- 该方法结合自动生成(AutoG, AutoID)与人工筛选(MnlG),并整合为混合方法(CGEdit),以提升鲁棒性。
- 通过Prec@100、ROC-AUC和AP等指标,在多个数据集和特征类型上评估性能。
- 通过将模型预测与已知的年龄、性别及地域差异的社会语言学模式进行比较,开展外部有效性验证。
实验结果
研究问题
- RQ1基于语料库引导、人工参与的方法能否生成高质量的对比集,从而提升低资源英语变体中形态句法特征的检测能力?
- RQ2所提出的CGEdit方法在印度英语和非洲裔美国人英语中检测特征时,其性能与自动和人工基线方法相比如何?
- RQ3模型预测在多大程度上与既有的关于年龄、性别及地域差异中特征使用情况的社会语言学发现一致?
- RQ4该方法能否在不同语料库和时间周期(包括历史和当代数据)上实现泛化?
主要发现
- CGEdit方法在印度英语和非洲裔美国人英语数据集上的Prec@100得分相比先前方法最高提升16个百分点,显著提升了特征检测的准确性。
- 在fwp语料库上,CGEdit方法在'non-init. exist. there'特征上的Prec@100得分为08.42,而AutoG为03.29,AutoID为00.69,显示出显著改进。
- 该方法成功验证了社会语言学发现:男性及普林斯顿地区(Princeville)的特征频率高于华盛顿特区(DC)和罗切斯特(Rochester),与先前研究一致。
- 模型预测年轻说话者及低社会经济群体中特征使用频率更高,与Grieser(2019)及Cukor-Avila和Balcazar(2019)的研究发现一致。
- 各年龄组间特征频率的标准差通常大于组间差异,表明个体间变异程度高,而该模型准确捕捉到了这一特征。
- 发布10个印度英语和17个非洲裔美国人英语特征检测模型及其训练数据,为低资源语言变体分析的可复现与可扩展研究提供了支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。