Skip to main content
QUICK REVIEW

[論文レビュー] Hindi Question Generation Using Dependency Structures

Kaveri Anuranjana, Vijjini Anvesh Rao|arXiv (Cornell University)|Jun 20, 2019
Topic Modeling参考文献 22被引用数 4
ひとこと要約

この論文は、ヒンディー語依存解析器から得られるカラカ-依存構造とインド語ワードネットを用いて意味的役割ラベリングを行うルールベースのヒンディー語質問生成システムを提示する。カラカ役割に基づく変換ルールを適用し、文法的に正しい多様な質問を生成する。文法的および意味的フィルタを適用することで、30文から112の質問を生成し、過剰生成を抑制しながら質の向上を図った。

ABSTRACT

Hindi question answering systems suffer from a lack of data. To address the same, this paper presents an approach towards automatic question generation. We present a rule-based system for question generation in Hindi by formalizing question transformation methods based on karaka-dependency theory. We use a Hindi dependency parser to mark the karaka roles and use IndoWordNet a Hindi ontology to detect the semantic category of the karaka role heads to generate the interrogatives. We analyze how one sentence can have multiple generations from the same karaka role's rule. The generations are manually annotated by multiple annotators on a semantic and syntactic scale for evaluation. Further, we constrain our generation with the help of various semantic and syntactic filters so as to improve the generation quality. Using these methods, we are able to generate diverse questions, significantly more than number of sentences fed to the system.

研究の動機と目的

  • ヒンディー語の質問応答システムにおける学習データの不足を補うために、自動的に多様で高品質な質問を生成すること。
  • ラベル付き学習データを必要としないルールベースの質問生成フレームワークを開発し、ヒンディー語のような低資源言語に適していること。
  • 過剰生成を抑えるために文法的および意味的フィルタを適用することで質問の質を向上させること。
  • 母語話者のヒンディー語話者による評価を通じて、生成された質問の意味的および文法的妥当性を評価すること。
  • 依存解析と意味的オントロジーが、インドの低資源言語における自然言語処理タスクに与える可能性を検討すること。

提案手法

  • システムは、パニニの文法およびカラカ理論に基づき、ヒンディー語依存解析器を用いて文におけるカラカ役割(例:k1 は主体、k2 は対象)を特定する。
  • 疑問詞(例:क्यों, किसने, किसने)は、格のマーク(直接格 vs. 補格)に基づきカラカ役割にマッピングされ、質問テンプレートが生成される。
  • インド語ワードネットを用いてカラカ役割の頭部の意味的カテゴリを特定し、より文脈に適した質問の作成を可能にする。
  • 各文を、カラカ役割を問う対象に応じて複数の質問タイプ(例:誰、何、いつ、なぜ)に変換するルールが適用される。
  • 文順(SOV)違反、複数の疑問詞、複雑/複合文構造を含む質問を除外するため、文法的フィルタが適用される。
  • ツールの制限のため意味的フィルタは部分的に実装されているが、今後の作業ではインド語ワードネットを用いて性別一致および意味的一致性を解決する予定である。

実験結果

リサーチクエスチョン

  • RQ1大規模なアノテート済みデータセットに依存せずに、多様で文法的に正しいヒンディー語質問をルールベースのシステムが生成できるか。
  • RQ2カラカ-依存構造と格のマークは、ヒンディー語の質問生成を効果的に支援できるか。
  • RQ3文法的および意味的フィルタは、自動生成された質問の質をどの程度向上できるか。
  • RQ4過剰生成は生成された質問の質にどのような影響を与えるか。フィルタリングにより意味的および文法的正確性は向上するか。
  • RQ5依存解析とオントロジーに基づく意味的ラベリングは、低資源インド語における質問生成を向上させることができるか。

主な発見

  • わずか30文の入力から112の質問が生成され、質問の多様性と過剰生成の度合いが顕著に示された。
  • 文法的および意味的フィルタの適用により、意味的および文法的評価スケールでそれぞれ0.2~0.4ポイントの質の向上が達成された。
  • 母語話者のヒンディー語話者による評価では、生成された質問が意味的および文法的に妥当であると評価され、ルールベースの手法の有効性が裏付けられた。
  • システムが依存解析に依存しているため、解析エラーが質問生成に伝搬されることが明らかになった。これは、長文や複雑な文において堅牢な解析器の必要性を示している。
  • 名詞の性別一致および動詞の語形一致は未解決の課題であり、今後の作業ではインド語ワードネットを統合して動的な動詞形の調整を実現する必要がある。
  • 格のマーク(例:'ने', 'को')の使用が、適切な疑問詞と動詞一致を決定する上で極めて重要であり、特に補格構造において顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。