Skip to main content
QUICK REVIEW

[논문 리뷰] Hindi Question Generation Using Dependency Structures

Kaveri Anuranjana, Vijjini Anvesh Rao|arXiv (Cornell University)|2019. 06. 20.
Topic Modeling참고 문헌 22인용 수 4
한 줄 요약

이 논문은 히누어 의존 구조와 인도워드넷을 활용하여 의미 역할 레이블링을 수행하는 규칙 기반 히누어 질문 생성 시스템을 제시한다. 카라카-의존 관계 기반의 변환 규칙을 적용하고 문법적 및 의미적 필터를 통과시켜, 30개 문장에서 112개의 다양하고 문법적으로 올바른 질문을 생성한다. 정제 과정을 통해 품질을 크게 향상시키면서도 높은 다양성을 유지한다.

ABSTRACT

Hindi question answering systems suffer from a lack of data. To address the same, this paper presents an approach towards automatic question generation. We present a rule-based system for question generation in Hindi by formalizing question transformation methods based on karaka-dependency theory. We use a Hindi dependency parser to mark the karaka roles and use IndoWordNet a Hindi ontology to detect the semantic category of the karaka role heads to generate the interrogatives. We analyze how one sentence can have multiple generations from the same karaka role's rule. The generations are manually annotated by multiple annotators on a semantic and syntactic scale for evaluation. Further, we constrain our generation with the help of various semantic and syntactic filters so as to improve the generation quality. Using these methods, we are able to generate diverse questions, significantly more than number of sentences fed to the system.

연구 동기 및 목표

  • 히누어 질문 응답 시스템의 훈련 데이터 부족 문제를 해결하기 위해 자동으로 다양하고 고급질의 질문을 생성하는 것.
  • 라벨이 부여된 훈련 데이터가 필요로 하지 않는 규칙 기반 질문 생성 프레임워크를 개발하여, 히누어와 같은 저자원 언어에 적합한 것.
  • 과다 생성을 줄이면서도 의미적 및 문법적 정확성을 유지하기 위해 문법적 및 의미적 필터를 적용하여 질문 품질을 향상시키는 것.
  • 생성된 질문을 모국어가 히누어인 사람들이 의미적 및 문법적 기준으로 평가함으로써 시스템을 평가하는 것.
  • 의존 구문 분석과 의미 온톨로지가 인도어 저자원 언어 NLP 과제에 어떻게 기여할 수 있는지 탐색하는 것.

제안 방법

  • 시스템은 히누어 의존 구문 분석기를 사용하여 파니니안 문법과 카라카 이론에 기반해 문장 내 카라카 역할(예: k1은 주체, k2는 목적어)을 식별한다.
  • 의문어(예: kyon, kisne, kisne)는 사례 표기자(직접격 vs. 간접격)에 따라 카라카 역할에 매핑되어 질문 템플릿을 생성한다.
  • 인도워드넷을 사용해 카라카 역할의 머리어휘의 의미 범주를 결정함으로써 더 맥락에 맞는 질문 생성을 가능하게 한다.
  • 각 문장을 질문 유형(예: 누가, 무엇, 언제, 왜 등)으로 변환하기 위해 카라카 역할에 기반한 규칙를 적용한다.
  • 문장의 어순(SOV 어순 위반), 다중 의문어, 복합문/복합문 구조를 포함한 문장은 문법적 필터를 통해 제거된다.
  • 도구의 제약으로 인해 의미적 필터는 부분적으로 구현되었지만, 향후 작업으로는 인도워드넷을 활용해 성별 일치 및 의미 일致성을 해결할 계획이다.

실험 결과

연구 질문

  • RQ1대규모 레이블링된 데이터셋에 의존하지 않고도 규칙 기반 시스템이 다양하고 문법적으로 올바른 히누어 질문을 생성할 수 있는가?
  • RQ2카라카-의존 관계 역할과 사례 표기자가 히누어 질문 생성에 얼마나 효과적인가?
  • RQ3문법적 및 의미적 필터는 자동 생성된 질문의 품질을 어느 정도 향상시키는가?
  • RQ4과다 생성은 생성된 질문의 품질에 어떤 영향을 미치며, 필터링을 통해 의미적 및 문법적 정확도를 향상시킬 수 있는가?
  • RQ5의존 구문 분석과 온톨로지 기반 의미 레이블링은 저자원 인도어 언어의 질문 생성을 어떻게 향상시킬 수 있는가?

주요 결과

  • 30개의 입력 문장에서 112개의 질문을 생성하여 높은 수준의 질문 다양성과 과다 생성을 입증하였다.
  • 문법적 및 의미적 필터를 적용함으로써 의미 평가 척도와 문법 평가 척도에서 각각 0.2에서 0.4점의 품질 향상을 달성하였다.
  • 모국어가 히누어인 사용자들이 생성된 질문을 의미적으로나 문법적으로 타당하다고 평가하여 규칙 기반 접근의 효과성을 검증하였다.
  • 시스템이 의존 구문 분석에 의존하기 때문에, 구문 분석 오류가 질문 생성에 영향을 미치며, 특히 긴 문장이나 복잡한 문장에서는 강력한 구문 분석기가 필요함을 시사한다.
  • 성별 일치 및 동사의 형태적 일치 문제는 아직 해결되지 않은 과제이며, 향후 인도워드넷을 통합해 동적 동사 형태 조정이 필요하다.
  • 사용된 사례 표기자(예: 'ne', 'ko')는 특히 간접격 문장에서 올바른 의문어와 동사 일치를 결정하는 데 핵심적인 역할을 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.