Skip to main content
QUICK REVIEW

[论文解读] Choosing the Right Word: Using Bidirectional LSTM Tagger for Writing Support Systems

Victor Makarenkov, Lior Rokach|arXiv (Cornell University)|Jan 8, 2019
Topic Modeling参考文献 38被引用 4
一句话总结

本文提出了一种双向LSTM标注器,用于写作辅助系统中的自动词汇选择支持,特别针对英语作为第二语言(ESL)学习者。通过利用大规模、未标注的文本语料库,无需人工标注,该模型学习上下文合适的词汇替换,其在特定领域(科技写作)和通用写作任务中的表现均优于最先进方法,主要贡献包括一种新颖的无监督方法,以及公开共享的代码、模型和ESL测试集。

ABSTRACT

Scientific writing is difficult. It is even harder for those for whom English is a second language (ESL learners). Scholars around the world spend a significant amount of time and resources proofreading their work before submitting it for review or publication. In this paper we present a novel machine learning based application for proper word choice task. Proper word choice is a generalization the lexical substitution (LS) and grammatical error correction (GEC) tasks. We demonstrate and evaluate the usefulness of applying bidirectional Long Short Term Memory (LSTM) tagger, for this task. While state-of-the-art grammatical error correction uses error-specific classifiers and machine translation methods, we demonstrate an unsupervised method that is based solely on a high quality text corpus and does not require manually annotated data. We use a bidirectional Recurrent Neural Network (RNN) with LSTM for learning the proper word choice based on a word's sentential context. We demonstrate and evaluate our application on both a domain-specific (scientific), writing task and a general-purpose writing task. We show that our domain-specific and general-purpose models outperform state-of-the-art general context learning. As an additional contribution of this research, we also share our code, pre-trained models, and a new ESL learner test set with the research community.

研究动机与目标

  • 为解决写作中正确词汇选择的挑战,特别是针对在语法错误和词汇替换方面存在困难的ESL学习者。
  • 开发一种统一的无监督模型,使其在语法错误纠正(GEC)和词汇替换(LS)任务中均具有泛化能力。
  • 消除对人工标注训练数据的依赖,实现无需昂贵人工标注的可扩展部署。
  • 构建一种实用的、面向真实场景的写作辅助工具,基于语言模式建议上下文准确的词汇替换。
  • 向自然语言处理研究社区贡献一个新的、贴近实际的ESL学习者测试集、预训练模型和开源代码。

提出的方法

  • 在大规模单语文本语料库上训练双向长短期记忆(LSTM)网络,以学习词汇的上下文表征。
  • 该模型在给定句子上下文中预测最可能的正确词汇,将词汇选择问题视为标注问题。
  • 该方法仅使用未标注的高质量文本数据——无需人工标注的错误或替换标签。
  • 该模型在两个设置下进行微调和评估:特定领域的科技写作语料库和通用语料库(COCA)。
  • 基于模型对每个掩码词汇在词汇表上的预测概率分布,生成词汇替换建议。
  • 评估采用人类编辑的测试集上的均 reciprocated rank(MRR),以衡量建议纠正结果的排序质量。

实验结果

研究问题

  • RQ1一个单一的无监督双向LSTM模型能否有效同时处理词汇选择中的语法错误纠正和词汇替换任务?
  • RQ2该模型在通用和特定领域写作任务中,与最先进监督式GEC和LS系统相比,性能如何?
  • RQ3该模型在不同写作风格(如科技英语与通用英语)之间具有多大程度的泛化能力?
  • RQ4当原句中存在细微搭配或词形错误时,该模型在建议正确词汇方面的有效性如何?
  • RQ5该模型是否可以在无需任何人工标注训练数据的情况下应用,同时仍达到具有竞争力的性能?

主要发现

  • 特定领域模型在合并正确列表测试集上的MRR达到0.61,显著优于单选项模型的下限。
  • 通用模型在交集测试集上的MRR达到0.49,表明其在多样化词汇选择任务中表现强劲。
  • 在人工收集的ESL测试集上,特定领域模型的MRR达到0.27,显示出在真实写作场景中的实际应用价值。
  • 该模型在科技写作和通用写作评估中均优于最先进上下文学习模型。
  • 该系统在处理多种错误类型(包括搭配、词形和冠词使用错误)方面表现出鲁棒性,且无需依赖错误类型专用分类器。
  • 作者成功公开了一个新的、贴近实际的ESL学习者测试集、预训练模型和代码,实现了可复现性并推动了进一步研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。