Skip to main content
QUICK REVIEW

[論文レビュー] Question Generation from a Knowledge Base with Web Exploration

Linfeng Song, Lin Zhao|arXiv (Cornell University)|Oct 12, 2016
Topic Modeling参考文献 17被引用数 12
ひとこと要約

本稿では、知識ベースから生成された小規模なテンプレートベースの質問を、ウェブ検索を活用して拡張する質問生成システムを提案する。この手法により、人的作業を著しく削減できる。既存の質問を繰り返し検索エンジンに問い合わせ、自然で分野に適した候補を選択することで、ニューラル機械翻訳ベースラインと比較してより自然で文法的に正しい質問を生成する。Freebaseの三項節に対して人的評価により確認された結果、その有効性が裏付けられている。

ABSTRACT

Question generation from a knowledge base (KB) is the task of generating questions related to the domain of the input KB. We propose a system for generating fluent and natural questions from a KB, which significantly reduces the human effort by leveraging massive web resources. In more detail, a seed question set is first generated by applying a small number of hand-crafted templates on the input KB, then more questions are retrieved by iteratively forming already obtained questions as search queries into a standard search engine, before finally questions are selected by estimating their fluency and domain relevance. Evaluated by human graders on 500 random-selected triples from Freebase, questions generated by our system are judged to be more fluent than those of ewcite{serban-EtAl:2016:P16-1} by human graders.

研究の動機と目的

  • ウェブリソースを活用することで、大規模な人的アノテーションデータに依存せずに、知識ベースからの質問生成における人的作業を削減すること。
  • ニューラル機械翻訳アプローチと比較して、生成された質問のなめらかさ(fluency)と自然さを向上させること。
  • ウェブコンテンツの変化に伴っても関連性を保ち続ける、スケーラブルで自己更新可能な質問生成を可能にすること。
  • 検索駆動の取得手法を用いて、分野の関連性を維持しつつ質問カバレッジを拡大する手法を開発すること。

提案手法

  • 知識ベースの各述語に対して、主語および目的語エンティティのプレースホルダを含む、手作業で作成された小規模な質問テンプレートを作成する。
  • これらのテンプレートを知識ベースの三項節に適用することで、初期質問(シード質問)を生成する。
  • 生成された質問を標準の検索エンジン(例:Google)の検索クエリとして使用し、ウェブから関連する質問を取得することで、質問拡張を実行する。
  • 新しく取得した質問を検索エンジンに繰り返し問い合わせることで、質問セットを段階的に拡張する。重複を避けるために、セットベースの追跡メカニズムを用いる。
  • 自然さと分野関連性の推定を、言語モデルと分野分類の組み合わせにより行い、分野関連性は分野固有のドキュメントクラスタへの単語埋め込みの平均化とコサイン類似度を用いて計算する。
  • 最終的な候補セットは、自然さと関連性スコアに基づいてフィルタリングされ、高品質で自然な質問が得られる。

実験結果

リサーチクエスチョン

  • RQ1ウェブ検索を用いて、小規模な初期質問セットを、大規模で多様性に富み、自然な質問コーパスに拡張することは可能か?
  • RQ2ウェブ探索を用いて生成された質問の自然さと文法的正確さは、ニューラル機械翻訳モデルから生成された質問と比べてどの程度優れているか?
  • RQ3人的アノテーションデータを大規模に必要とせずに、システムは質問生成を拡大する中で分野の関連性を維持できるか?
  • RQ4従来のトピックモデリング手法と比較して、単語埋め込みは分野関連性推定をどの程度向上させられるか?

主な発見

  • 人的評価では、本手法で生成された質問がニューラル機械翻訳ベースラインの質問よりも顕著に自然で文法的に正しいと評価され、両方の指標で平均スコアが高かった。
  • ウェブスニペットデータセットにおける分野分類精度は85.65を達成し、LDAやマルチスケールトピックを用いた先行の最先端手法を上回った。
  • 自社開発のパワーツール分野の知識ベースでは、12,228個の初期質問から20,000個の拡張質問を生成した。その多くは文法的に正しいだけでなく、分野に適した内容であった。
  • 本手法は、単語埋め込みが従来のトピックモデル(例:LDA)よりも、分野用語間の意味的類似性(例:'finance' と 'economy')をより効果的に捉えられることを示した。
  • 本手法は、'ルーターを使わず木材に溝を切る方法は?' といった複雑で情報量の多い質問を効果的に生成でき、単純な事実照会型の質問を超える能力を示した。
  • 本アプローチは、人的作業を最小限に抑え(小規模な質問テンプレートの作成に限定)、高品質な結果を達成できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。