Skip to main content
QUICK REVIEW

[論文レビュー] Open Domain Question Answering Using Web Tables

Kaushik Chakrabarti, Zhi‐Min Chen|arXiv (Cornell University)|Jan 10, 2020
Data Quality and Management参考文献 29被引用数 5
ひとこと要約

本論文では、深層ニューラルネットワークベースのクエリ-テーブル意味的類似度とテーブル優位性・品質特徴を組み合わせることで、ファクトイドおよび非ファクトイドクエリの両方をWebテーブルを用いて回答する、新規なオープンドメイン質問応答システムを提示する。このアプローチは、既存のベースラインを著しく上回り、実験では80%の再現率で20%の再現率を達成しており、大手商業検索エンジンに導入され、月間数千万件のテーブル回答を提供している。

ABSTRACT

Tables extracted from web documents can be used to directly answer many web search queries. Previous works on question answering (QA) using web tables have focused on factoid queries, i.e., those answerable with a short string like person name or a number. However, many queries answerable using tables are non-factoid in nature. In this paper, we develop an open-domain QA approach using web tables that works for both factoid and non-factoid queries. Our key insight is to combine deep neural network-based semantic similarity between the query and the table with features that quantify the dominance of the table in the document as well as the quality of the information in the table. Our experiments on real-life web search queries show that our approach significantly outperforms state-of-the-art baseline approaches. Our solution is used in production in a major commercial web search engine and serves direct answers for tens of millions of real user queries per month.

研究の動機と目的

  • Webテーブルを用いて、リストや順位付け、構造化データを求めるような非ファクトイドクエリを効果的に回答する課題に対処すること。
  • 既存のIRベースおよび優位テーブルベースのベースラインを上回る、オープンドメインQAにおけるテーブル回答選択の精度を向上させること。
  • ファクトイドおよび非ファクトイドクエリの両方を効果的に処理できる統合フレームワークを構築すること。
  • 意味的関連性、テーブル優位性、情報品質に基づいて、多数の候補テーブルの中から最も関連性の高いものを特定・順序付けすること。

提案手法

  • システムは、与えられたクエリに対して、Web検索エンジンを用いて候補テーブルプールを取得する。
  • クエリと各候補テーブルの間で、深層ニューラルネットワークベースの意味的類似度を計算し、関連性を評価する。
  • 3種類の特徴を組み込む:ドキュメント内テーブル割合(優位性)、ドキュメント内でのテーブル位置、テーブル品質メトリクス。
  • 学習による順序付けモデルが、クエリ-テーブル意味的類似度と優位性・品質特徴を統合し、最適なテーブル回答をスコア化・選択する。
  • モデルは実際のユーザークエリ上で学習・評価され、精度と再現率をさまざまな閾値で測定する。
  • 高いIRマッチでも関連性が低いテーブルを回避するように設計されており、優位性が低いか品質が低いテーブルにはペナルティが課される。

実験結果

リサーチクエスチョン

  • RQ1ファクトイドおよび非ファクトイドクエリの両方をWebテーブルを用いて効果的に処理できる統合的アプローチは、実現可能か?
  • RQ2ニューラル意味的類似度とテーブル優位性・品質特徴を組み合わせることで、IRベースや優位テーブルベースのベースラインに比べ、テーブル回答選択がどの程度向上するか?
  • RQ3テーブル優位性および品質特徴は、高いIRマッチだが低関連性のテーブルに起因する誤検出(ファルスポジティブ)をどの程度低減するか?
  • RQ4高精度なテーブル回答選択を達成するために、意味的類似度と優位性・品質特徴の相対的な貢献度はどの程度か?

主な発見

  • 意味的類似度、優位性、品質の3つの特徴グループをすべて使用した場合、本手法は20%の再現率を80%の再現率で達成し、ベースラインを著しく上回った。
  • 意味的類似度を除いた優位性および品質特徴のみを用いた場合、80%の再現率で16%の再現率を達成し、深層学習を用いなくてもこれらの特徴の価値が示された。
  • クエリ-テーブル意味的類似度特徴を含めることで、優位性および品質特徴のみを使用した場合に比べ、80%の再現率で再現率が4%向上した。
  • 優位テーブルアプローチ単体では、上位順位のドキュメントが完璧な答えでないクエリでは失敗する。例えば「サラトガニューヨークの今後のレース」の例では、州レベルのテーブルが誤って選択された。
  • IRベースのベースラインは、テーブル回答において悪く、高IRマッチでも最良の答えでないテーブルを優先する。例えば「グラフデータベース」に関するWikipediaのテーブルが、実際の説明的コンテンツよりも優先された。
  • 本システムは大手商業Web検索エンジンにプロダクション環境で導入されており、月間数千万件の実ユーザークエリに対して直接的なテーブル回答を提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。