Skip to main content
QUICK REVIEW

[论文解读] Building a Word Segmenter for Sanskrit Overnight

Vikas Reddy, Amrith Krishna|arXiv (Cornell University)|Feb 8, 2018
Natural Language Processing Techniques参考文献 17被引用 5
一句话总结

该论文提出了一种无需知识、端到端的序列到序列(seq2seq)深度学习模型,用于梵语文本的分词,可直接将融合的沙迪特(sandhied)文本映射为分词形式,无需语言学预处理。该模型在并行的沙迪特/非沙迪特句子对上进行训练,相比当前最先进方法实现了16.79%的性能提升,在不同长度的句子中均表现出更高的精确率和召回率,且在单张GPU上训练时间不足12小时。

ABSTRACT

There is abundance of digitised texts available in Sanskrit. However, the word segmentation task in such texts are challenging due to the issue of Sandhi. In Sandhi, words in a sentence often fuse together to form a single chunk of text, where the word delimiter vanishes and sounds at the word boundaries undergo transformations, which is also reflected in the written text. Here, we propose an approach that uses a deep sequence to sequence (seq2seq) model that takes only the sandhied string as the input and predicts the unsandhied string. The state of the art models are linguistically involved and have external dependencies for the lexical and morphological analysis of the input. Our model can be trained “overnight” and be used for production. In spite of the knowledge lean approach, our system preforms better than the current state of the art by 16.79 %.

研究动机与目标

  • 为解决梵语中因沙迪(sandhi)导致词边界融合及音变现象,使传统分词方法难以实施的挑战。
  • 开发一种可扩展、低资源的解决方案,绕过复杂的语言学预处理和外部词典资源。
  • 实现快速、自动化的训练与推理,适用于梵语文本分词的生产环境部署。
  • 通过数据驱动、端到端的深度学习方法,超越现有最先进系统。
  • 证明无需语言知识的模型可在梵语文本分词任务中超越依赖语言学知识的系统。

提出的方法

  • 采用带有双向LSTM编码器和注意力机制的序列到序列(seq2seq)模型,将沙迪特输入序列映射为非沙迪特输出序列。
  • 模型在并行的梵语沙迪特与分词句子对上进行训练,以最大化正确分词的条件概率。
  • 使用SentencePiece作为无监督子词分词工具,从训练数据中学习新的、优化的词汇表,提升模型泛化能力。
  • 解码器从其学习到的词汇表中生成输出标记,不依赖预定义的词边界或词形标签。
  • 在配备12GB显存的Titan X GPU上进行训练,最佳模型在12小时内完成收敛。
  • 系统采用编码器-解码器架构并引入注意力机制,以提升长句中输入与输出序列之间的对齐效果。

实验结果

研究问题

  • RQ1纯粹基于数据驱动、端到端的深度学习模型能否在梵语文本分词任务中超越依赖语言学知识的系统?
  • RQ2在低资源、词形丰富的语言(如梵语)中,无知识依赖的方法能在多大程度上实现高性能?
  • RQ3注意力机制在长句或复杂沙迪特字符串中的分词任务中如何提升准确率?
  • RQ4能否在12小时内完成训练并实现最先进性能,且无需外部语言学资源?
  • RQ5仅基于原始文本对进行训练的模型,是否能在不同长度和复杂度的句子上实现良好泛化?

主要发现

  • 所提出的带注意力机制的seq2seq模型(attnSegSeq2Seq)相比当前最先进方法,在分词性能上实现了16.79%的相对提升。
  • 该模型在精确率和召回率方面均优于现有系统,尤其在六词及以下的句子中表现更优。
  • 最佳性能模型在配备12GB显存的Titan X GPU上,经过80个周期训练,耗时11小时40分钟。
  • 系统在不同句子长度上均表现出稳健性能,测试集按词频和词数分组的结果保持一致。
  • 即使缺乏词形或词典资源,模型性能依然稳定且具备良好的泛化能力。
  • 该方法证明,无知识依赖、以数据为中心的方法可超越需要大量语言学预处理和外部依赖的系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。