Skip to main content
QUICK REVIEW

[論文レビュー] Watsonsim: Overview of a Question Answering Engine

Sean Gallagher, Wlodek Zadrozny|arXiv (Cornell University)|Dec 2, 2014
Topic Modeling被引用数 6
ひとこと要約

Watonsim は、大学の研究チームが開発したオープンソースの質問応答システムであり、検索エンジン(Lucene、Indri、Bing、Google)、自然言語処理ツール(OpenNLP、UIMA)、機械学習(Weka)のパイプラインを用いて、ジェopardy形式の質問に応答することを目的としている。制限されたリソースと時間制約の下でも、データクリーニング、パッセージスコアリング、システムスケーラビリティの課題が残る中、18%の正答率を達成した。

ABSTRACT

The objective of the project is to design and run a system similar to Watson, designed to answer Jeopardy questions. In the course of a semester, we developed an open source question answering system using the Indri, Lucene, Bing and Google search engines, Apache UIMA, Open- and CoreNLP, and Weka among additional modules. By the end of the semester, we achieved 18% accuracy on Jeopardy questions, and work has not stopped since then.

研究の動機と目的

  • 学期単位の学術的プロジェクト内で、ジェopardy形式のトリビア質問を処理できる機能的な質問応答システムの設計および実装を目的とする。
  • Wikipedia、Wikiquotes、シェイクスピアのテキストなど、複数のデータソースを統合し、一元化されたリtrievalパイプラインを構築することを目的とする。
  • 実世界のQA環境における、複数の検索エンジン(Lucene、Indri、Bing、Google)およびスコアリングモデルの性能を評価・比較することを目的とする。
  • オープンソースツールおよび既存の自然言語処理フレームワークを用いて、スケーラブルでモジュラーなQAシステムを構築する可能性を検討することを目的とする。
  • パッセージの検索性能が低く、自然言語処理のパースが非効率であるといった、現在のアプローチの限界を特定し、改善策を提案することを目的とする。

提案手法

  • 質問分類、クエリ生成、回答スコアリングの専用モジュールを備えたマルチステージのパイプラインアーキテクチャを採用している。
  • 事実系の質問は、コンテンツをタイトルよりも重視する重み付きクエリを用い、初期検索に Lucene、Indri、Bing を使用する。
  • 穴埋め系の質問は、アンダースコアを除去し、タイトルから候補となる回答を抽出した後、パッセージスコアリングを実施する。
  • 支援パラグラフは、n-gram類似度や語句頻度を含む、語彙的・構文的・意味的特徴の組み合わせを用いてスコアリングされる。
  • 複数の検索エンジンの結果を統合し、重複を除去することで冗長性を低減するハイブリッドリtrieバル戦略を採用している。
  • スコアリングモデルには、平均逆順位(MRR)とバイナリリCALLが含まれており、少なくとも1つの正解が存在する質問に限定して計算される。

実験結果

リサーチクエスチョン

  • RQ1小さな学術的チームは、公開利用可能なツールやデータソースのみを用いて、機能的でオープンソースの質問応答システムを構築できるか?
  • RQ2伝統的な検索エンジン(Lucene、Indri、Bing、Google)は、ジェopardy形式の質問に対して、関連する回答を効果的に検索できるか?
  • RQ3データ前処理の選択(例:Wikipediaのリダイレクトのインデクス化)は、回答の正答率およびランク品質にどのような影響を与えるか?
  • RQ4語彙的マッチングのみに依存する場合と比較して、自然言語処理ベースのスコアリングおよび意味的モデルは、回答選択をどの程度改善するか?
  • RQ5システムアーキテクチャ(例:UIMA とカスタムパイプライン)は、スケーラビリティ、保守性、パフォーマンスにどの程度影響を与えるか?

主な発見

  • システムはジェopardy形式の質問に対して18%の正答率を達成し、オープンソースツールを用いた学期内での機能的QAシステムの構築可能性を示した。
  • Wikipediaのリダイレクトをインデクス化することで、バイナリリCALLは22%から28%に上昇したが、平均逆順位(MRR)は0.6469から0.3483に低下し、全体の正答率は6%低下した。
  • Indri と Lucene を併用したオフラインクエリ処理では、バイナリリCALLが21%に達し、Lucene 単体(13%)を大きく上回った。
  • n-gram類似度と語句頻度を用いたパッセージスコアリングにより、回答のランク付けが改善されたが、自然言語処理ベースのパースは実用的な用途には遅すぎた。
  • Bing の月間5,000クエリの制限により、2回の性能測定が可能だったが、Google の1日100クエリの制限は大規模利用には現実的でなかった。
  • UIMA は導入が遅れたため、深く統合されなかったが、スケーラビリティおよび言語間相互運用性の観点から、将来的には優れた選択肢であると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。