Skip to main content
QUICK REVIEW

[论文解读] Improving historical spelling normalization with bi-directional LSTMs and multi-task learning

Marcel Bollmann, Anders Søgaard|arXiv (Cornell University)|Oct 25, 2016
Natural Language Processing Techniques参考文献 16被引用 4
一句话总结

本文提出一种用于早期新高德语历史拼写归一化的字符级双向LSTM模型,在训练数据有限的情况下仍优于CRF和Norma基线模型。通过引入额外的归一化数据进行多任务学习,进一步提升了性能,表明当结合辅助数据监督时,深度神经网络在低资源历史自然语言处理任务中同样有效。

ABSTRACT

Natural-language processing of historical documents is complicated by the abundance of variant spellings and lack of annotated data. A common approach is to normalize the spelling of historical words to modern forms. We explore the suitability of a deep neural network architecture for this task, particularly a deep bi-LSTM network applied on a character level. Our model compares well to previously established normalization algorithms when evaluated on a diverse set of texts from Early New High German. We show that multi-task learning with additional normalization data can improve our model's performance further.

研究动机与目标

  • 解决由于标注数据稀缺和拼写变异严重而导致的低资源历史拼写归一化挑战。
  • 评估深度双向LSTM网络在历史文本归一化字符级序列标注任务中的适用性。
  • 探究与传统数据增强相比,使用辅助归一化数据进行多任务学习是否能提升模型性能。
  • 在多样化的早期新高德语文本上,将所提模型与CRF和Norma工具等成熟方法进行比较。

提出的方法

  • 将拼写归一化建模为字符级序列标注任务,利用双向LSTM捕捉过去和未来字符的上下文依赖关系。
  • 通过将所有字符小写化,并在每个词前添加特殊词开始符号‘_’,对输入序列进行预处理。
  • 使用迭代Levenshtein距离对齐方法,并结合点互信息(pointwise mutual information)以偏好语言学上更合理的匹配,生成历史形式与归一化形式之间的字符级对齐。
  • 使用ε(ε)标签表示未对齐的历史字符,并在归一化字符未与任何历史字符对齐时执行向左合并操作。
  • 通过在主归一化任务和使用额外的、相似但不完全相同的古语文本的辅助归一化任务上联合训练,应用多任务学习。
  • 另一次实验探索将音素图素到音素的映射作为辅助任务,但未带来显著性能提升。

实验结果

研究问题

  • RQ1深度双向LSTM模型是否能在低资源历史拼写归一化任务中超越CRF和Norma?
  • RQ2与简单数据拼接相比,使用额外归一化数据进行多任务学习是否能进一步提升模型准确率?
  • RQ3多任务学习的优势是否特异性地体现在与目标任务具有相似语言特征的数据上?
  • RQ4在多任务设置中,辅助任务如图素到音素映射是否能提升归一化性能?

主要发现

  • 该双向LSTM模型在Anselm语料库中的42篇(共44篇)文本上优于CRF基线和Norma工具,表明其在多样化早期新高德语文本上具备强大的泛化能力。
  • 即使仅使用1,000个训练词符,该模型仍能取得具有竞争力的结果,显示出在低数据场景下的有效性。
  • 通过辅助归一化数据进行多任务学习,其准确率提升超越了单纯数据拼接的上限,且CRF与Norma均未表现出类似优势。
  • 多任务学习的收益具有特定性:当使用图素到音素映射作为辅助任务时,平均性能反而下降了0.4个百分点。
  • 该模型在具有不同方言和时间特征的文本上表现稳健,表明其对拼写变异具有强大的泛化能力。
  • 使用迭代Levenshtein对齐结合点互信息显著提升了对齐质量,从而支持了更精确的序列标注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。