Skip to main content
QUICK REVIEW

[论文解读] Framework for Question-Answering in Sanskrit through Automated Construction of Knowledge Graphs

Hrishikesh Terdalkar, Arnab Bhattacharya|arXiv (Cornell University)|Oct 11, 2023
Topic Modeling参考文献 7被引用 4
一句话总结

本文提出了一种通过从古典文本自动生成知识图谱来构建梵语文本问答系统的方法。该方法应用于三个梵文语料库——《摩诃婆罗多》、《罗摩衍那》和《跋瓦普拉卡沙尼迦尼》——在事实类问题上实现了50%的准确率,同时识别出梵语自然语言处理流水线和知识图谱构建中的关键局限性。

ABSTRACT

Sanskrit (sa\d{m}sk\d{r}ta) enjoys one of the largest and most varied literature in the whole world. Extracting the knowledge from it, however, is a challenging task due to multiple reasons including complexity of the language and paucity of standard natural language processing tools. In this paper, we target the problem of building knowledge graphs for particular types of relationships from sa\d{m}sk\d{r}ta texts. We build a natural language question-answering system in sa\d{m}sk\d{r}ta that uses the knowledge graph to answer factoid questions. We design a framework for the overall system and implement two separate instances of the system on human relationships from mahābhārata and rāmāya\d{n}a, and one instance on synonymous relationships from bhāvaprakāśa nigha\d{n}\d{t}u, a technical text from āyurveda. We show that about 50% of the factoid questions can be answered correctly by the system. More importantly, we analyse the shortcomings of the system in detail for each step, and discuss the possible ways forward.

研究动机与目标

  • 为解决由于语言复杂性及缺乏自然语言处理工具,从梵语文献中提取结构化知识的挑战。
  • 设计一种可扩展的框架,用于针对梵文文本中特定语义关系的自动化知识图谱构建。
  • 实现并评估一种利用这些知识图谱回答梵文事实类问题的问答系统。
  • 分析流水线中各组件(尤其是自然语言处理处理和知识图谱构建)的局限性,以促进未来改进。

提出的方法

  • 该框架使用基于规则和自然语言处理技术的方法,从梵文文本中提取特定类型的语义关系(例如,《摩诃婆罗多》中的人际关系,以及《跋瓦普拉卡沙尼迦尼》中的同义关系)。
  • 采用结合词形分析、词性标注、依存句法分析和关系抽取的流水线,构建结构化的知识图谱。
  • 系统利用基于知识图谱的检索机制,通过将查询模式与图结构化事实匹配,来回答梵文自然语言问题。
  • 该框架支持多种文本类型:史诗类(《摩诃婆罗多》、《罗摩衍那》)和技术论著类(《跋瓦普拉卡沙尼迦尼》),展示了其适应性。
  • 采用问题分类与槽位填充方法,将问题映射为知识图谱查询。
  • 评估基于从知识图谱中提取的事实类问题进行,答案通过与标准答案标注进行验证。

实验结果

研究问题

  • RQ1能否通过从梵文文本自动生成知识图谱,实现对事实类查询的有效问答?
  • RQ2当应用于包括史诗和专业技术文本在内的多种梵文语料库时,基于知识图谱的问答系统准确度如何?
  • RQ3在梵语知识图谱构建中,自然语言处理流水线的主要瓶颈是什么?
  • RQ4在缺乏预训练自然语言处理模型的情况下,基于规则和语言学处理技术能在多大程度上弥补不足?
  • RQ5不同文本体裁(如叙事类与技术类)如何影响所提取知识图谱的质量和可用性?

主要发现

  • 该系统在三个测试语料库的事实类问题上实现了50%的准确率,表明其性能中等但具有潜力。
  • 在《跋瓦普拉卡沙尼迦尼》数据集中表现最佳,表明技术性与结构化文本更易于生成可靠的知识图谱。
  • 梵语的词形和句法复杂性显著影响了实体和关系抽取的准确性,尤其在叙事类文本中更为明显。
  • 缺乏标准化的梵语自然语言处理工具,导致解析和实体链接错误,是系统失败的主要原因。
  • 依存句法分析和关系抽取对预处理流水线中的噪声特别敏感,凸显了对稳健语言学工具的需求。
  • 本研究识别出流水线各阶段的关键故障点,为未来梵语自然语言处理系统的改进提供了可操作的见解。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。