Skip to main content
QUICK REVIEW

[论文解读] Hindi Question Generation Using Dependency Structures

Kaveri Anuranjana, Vijjini Anvesh Rao|arXiv (Cornell University)|Jun 20, 2019
Topic Modeling参考文献 22被引用 4
一句话总结

该论文提出了一种基于规则的印地语问题生成系统,利用印地语依存句法分析器生成的卡拉卡-依存结构以及IndoWordNet进行语义角色标注,以生成多样且语法正确的问题。通过基于卡拉卡角色应用转换规则,并结合句法和语义过滤,系统从30个句子中生成了112个问题,通过修剪显著提升了质量,同时保持了较高的多样性。

ABSTRACT

Hindi question answering systems suffer from a lack of data. To address the same, this paper presents an approach towards automatic question generation. We present a rule-based system for question generation in Hindi by formalizing question transformation methods based on karaka-dependency theory. We use a Hindi dependency parser to mark the karaka roles and use IndoWordNet a Hindi ontology to detect the semantic category of the karaka role heads to generate the interrogatives. We analyze how one sentence can have multiple generations from the same karaka role's rule. The generations are manually annotated by multiple annotators on a semantic and syntactic scale for evaluation. Further, we constrain our generation with the help of various semantic and syntactic filters so as to improve the generation quality. Using these methods, we are able to generate diverse questions, significantly more than number of sentences fed to the system.

研究动机与目标

  • 通过自动生成多样且高质量的问题,解决印地语问答系统训练数据稀缺的问题。
  • 开发一种无需标注训练数据的基于规则的问题生成框架,使其适用于印地语等低资源语言。
  • 通过应用句法和语义过滤,提升问题质量,减少过度生成,同时保持语义和句法正确性。
  • 通过母语印地语者对生成问题在语义和句法层面进行评分,对系统进行评估。
  • 探索依存句法分析和语义本体在印度语言低资源自然语言处理任务中的潜力。

提出的方法

  • 系统使用印地语依存句法分析器识别句子中的卡拉卡角色(例如,k1表示施事,k2表示受事),依据吠陀语法学和卡拉卡理论。
  • 疑问词(例如,kyon, kisne, kisne)根据格标记(直接格与与格)映射到卡拉卡角色,以生成问题模板。
  • 使用IndoWordNet确定卡拉卡角色核心词的语义类别,从而实现更符合上下文的问题生成。
  • 基于被提问的卡拉卡角色,应用规则将每个句子转换为多种问题类型(例如,谁、什么、何时、为什么)。
  • 应用句法过滤器,以去除违反词序(SOV)、包含多个疑问词或复杂/复合句结构的问题。
  • 由于工具限制,语义过滤部分实现,但未来工作将利用IndoWordNet解决性别一致性和语义一致性问题。

实验结果

研究问题

  • RQ1基于规则的系统能否在不依赖大规模标注数据集的情况下,生成多样且语法正确的印地语问题?
  • RQ2卡拉卡-依存角色和格标记在指导印地语问题生成方面有多有效?
  • RQ3句法和语义过滤在多大程度上提升了自动生成问题的质量?
  • RQ4过度生成如何影响生成问题的质量?过滤能否提升语义和句法正确性?
  • RQ5依存句法分析和基于本体的语义标注能否增强低资源印度语言的问题生成?

主要发现

  • 系统仅从30个输入句子中生成了112个问题,表明问题多样性高且存在过度生成现象。
  • 应用句法和语义过滤后,生成问题在语义和句法评估量表上的质量分别提升了0.2至0.4分。
  • 母语印地语者对生成问题的语义和句法有效性给予肯定评分,验证了基于规则方法的有效性。
  • 系统依赖依存句法分析,因此句法分析中的错误会传播到问题生成中,凸显了在长句或复杂句中使用鲁棒句法分析器的必要性。
  • 动词的性别一致性和形态一致性仍为未解决的挑战,未来需整合IndoWordNet以实现动词形式的动态调整。
  • 使用格标记(例如,'ne', 'ko')在确定正确疑问词和动词一致方面至关重要,尤其在与格结构中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。