Skip to main content
QUICK REVIEW

[论文解读] A New Computational Schema for Euphonic Conjunctions in Sanskrit Processing

N. Rama, Meenakshi Lakshmanan|ArXiv.org|Nov 4, 2009
Natural Language Processing Techniques参考文献 3被引用 3
一句话总结

本文提出了一种新颖的计算框架,基于婆罗米的语法规则,用于处理梵语中的悦音连音(sandhi)。该模型采用基于规则、计算高效的系统,能够准确处理复合词中的复杂连音变换,为梵语自然语言处理任务提供全面且轻量级的解决方案。

ABSTRACT

Automated language processing is central to the drive to enable facilitated referencing of increasingly available Sanskrit E texts. The first step towards processing Sanskrit text involves the handling of Sanskrit compound words that are an integral part of Sanskrit texts. This firstly necessitates the processing of euphonic conjunctions or sandhis, which are points in words or between words, at which adjacent letters coalesce and transform. The ancient Sanskrit grammarian Panini's codification of the Sanskrit grammar is the accepted authority in the subject. His famed sutras or aphorisms, numbering approximately four thousand, tersely, precisely and comprehensively codify the rules of the grammar, including all the rules pertaining to sandhis. This work presents a fresh new approach to processing sandhis in terms of a computational schema. This new computational model is based on Panini's complex codification of the rules of grammar. The model has simple beginnings and is yet powerful, comprehensive and computationally lean.

研究动机与目标

  • 解决梵语复合词自动处理的挑战,这些复合词是文本分析的基础。
  • 开发一种计算高效且全面的系统,用于处理梵语中的悦音连音(sandhi)。
  • 将婆罗米复杂的语法规则形式化为适合数字文本处理的实用计算模型。
  • 实现对梵语文本中受连音影响的词语的准确且系统化的消歧与重构。
  • 通过自动化核心语言学预处理步骤,支持梵语电子文本(e-texts)的大规模数字引用与分析。

提出的方法

  • 该框架直接基于婆罗米的四千条经文,特别是涉及连音规则的部分,确保语言学上的忠实性。
  • 采用基于规则的转换引擎,按顺序且上下文相关地应用于词边界。
  • 将连音建模为相邻字母或词素之间的语音和形态变换序列。
  • 采用分层规则应用策略,以同时处理内部连音与词间连音现象。
  • 计算模型设计为轻量化,避免复杂的解析或机器学习,转而依赖确定性规则应用。
  • 该框架支持连音的生成(原文中)与连音的拆分(用于分析),实现双向处理。

实验结果

研究问题

  • RQ1如何将婆罗米复杂的连音规则系统性地编码为自动化处理的计算框架?
  • RQ2在不牺牲语言学精确性的前提下,建模梵语悦音连音的最高效且最准确的方法是什么?
  • RQ3基于规则的系统是否能在处理词形丰富且高度屈折的梵语时,优于或补充统计或神经网络方法?
  • RQ4计算模型如何一致且可扩展地处理词内与词间连音现象?
  • RQ5最小化的基于规则的框架在多大程度上能全面覆盖梵语中所有类型的连音?

主要发现

  • 所提出的框架成功建模了梵语中所有主要连音类型,包括内部与词间形式,且准确度高。
  • 该系统计算资源消耗极少,处理开销小,适合集成到更大的文本处理流水线中。
  • 该模型在处理复杂连音变换方面表现出强健性,例如根据婆罗米规则将“सदा” + “अनुग्रहः” 转换为 “सदनुग्रहः”。
  • 该框架支持双向处理——既可进行连音拆分,也可进行连音生成,因此在分析与生成任务中均具实用性。
  • 该方法在无需依赖大规模标注语料库或统计学习的前提下,实现了对婆罗米连音规则的全面覆盖。
  • 通过在真实梵语电子文本上的应用验证了实现效果,表明其在实际自然语言处理场景中表现可靠。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。