Skip to main content
QUICK REVIEW

[論文レビュー] Interpretation of Natural Language Rules in Conversational Machine Reading

Marzieh Saeidi, Max Bartolo|arXiv (Cornell University)|Aug 28, 2018
Topic Modeling参考文献 30被引用数 4
ひとこと要約

本稿では、自然言語ルールを解釈し、背景知識を適用して '私は〜できますか?' や '私は〜しなければなりませんか?' といった質問に、対話形式で応答する必要がある、会話型機械読解(CMR)というタスクを紹介する。仮想ユーザーを用いた新規のクラウドソーシングプロトコルにより、32,000件のインスタンスを含むデータセットを収集した。モデルは背景知識が不要な場合には良好な性能を示すが、背景知識が必要となる場合には顕著な改善が求められることから、実世界のQAにおけるルール解釈の難しさが浮き彫りになる。

ABSTRACT

Most work in machine reading focuses on question answering problems where the answer is directly expressed in the text to read. However, many real-world question answering problems require the reading of text not because it contains the literal answer, but because it contains a recipe to derive an answer together with the reader's background knowledge. One example is the task of interpreting regulations to answer "Can I...?" or "Do I have to...?" questions such as "I am working in Canada. Do I have to carry on paying UK National Insurance?" after reading a UK government website about this topic. This task requires both the interpretation of rules and the application of background knowledge. It is further complicated due to the fact that, in practice, most questions are underspecified, and a human assistant will regularly have to ask clarification questions such as "How long have you been working abroad?" when the answer cannot be directly derived from the question and text. In this paper, we formalise this task and develop a crowd-sourcing strategy to collect 32k task instances based on real-world rules and crowd-generated questions and scenarios. We analyse the challenges of this task and assess its difficulty by evaluating the performance of rule-based and machine-learning baselines. We observe promising results when no background knowledge is necessary, and substantial room for improvement whenever background knowledge is needed.

研究の動機と目的

  • システムが自然言語ルールを解釈し、背景知識を適用して複雑な '私は〜できますか?' や '私は〜しなければなりませんか?' といった質問に、会話形式で応答するという、新たなタスク—会話型機械読解(CMR)を形式化すること。
  • 曇った質問への対処を目的として、確認質問とその回答を含む対話をモデル化すること。
  • 仮想ユーザーを用いたスケーラブルで制御可能なクラウドソーシングプロトコルを開発し、実際の規制ルールを基盤とした高品質で多様な対話データを生成すること。
  • 実際の英国政府規則に基づき、32,000件のタスクインスタンスを含む大規模かつ現実世界のデータセットを構築すること。
  • ベースラインモデルを評価し、背景知識が必要となる状況で性能が著しく低下することを示し、今後の研究における主な挑戦であることを明らかにすること。

提案手法

  • アノテーターが仮想ユーザーと協働して会話を構築する対話ベースのアノテーションインターフェースを設計。仮想ユーザーは事前に定義された回答を使用してフォローアップ質問に応答する。
  • 仮想ユーザーの応答を制御することで、'はい'と'いいえ'の回答比率と対話履歴の内容を管理し、バランスの取れた多様なデータ収集を確保する。
  • 実際の規制文書(例:英国の国民保険料規則)から32,000件のタスクインスタンスを収集。各インスタンスには、初期質問、シナリオ、ルールの抜粋、対話履歴、最終的な回答またはフォローアップ質問が含まれる。
  • 文脈、履歴、質問入力をエンコードするための、コピーメカニズムを備えたか否かのseq2seqニューラルモデルを用い、回答または確認質問を生成する。
  • マクロ正解率、BLEU-1、BLEU-4、および独自の指標(CM)を用いて、正解の質と自然さを評価する指標を用いて、モデルを訓練および評価する。
  • CMR支援QAと手動での規則読解を比較するユーザースタディを実施し、意思決定の速度と正確性を測定する。

実験結果

リサーチクエスチョン

  • RQ1モデルは、規制文書における自然言語ルールを解釈し、会話形式で複雑な '私は〜できますか?' や '私は〜しなければなりませんか?' といった質問に効果的に応答できるか?
  • RQ2背景知識の有無が、ルールベースの質問応答におけるモデルの性能にどのように影響するか?
  • RQ3制御された仮想ユーザーに基づくアノテーションプロトコルは、CMR用に高品質で多様かつバランスの取れた対話データをどれほど効果的に生成できるか?
  • RQ4コピーメカニズムを備えたか否かのseq2seqニューラルモデルは、CMRタスクにおいて、特に確認質問の生成において、どのように性能を発揮するか?
  • RQ5会話型エージェントを用いることで、手動での規則読解と比較して、ユーザーの質問への対応速度と正確性が顕著に向上するか?

主な発見

  • 背景知識が必要となる状況では、モデルの性能が背景知識なしの61.9%のマクロ正解率から、44.8%に低下することから、CMRタスクは背景知識が必要な場合に著しく困難であることが示された。
  • ユーザースタディの結果、会話型エージェントを用いた参加者は、規則を手動で読破する場合と比較して、正解に到達するまでの時間が2倍速く(2倍速く)、93%の正確性を示した。対照的に、手動での読破では68%の正確性であった。
  • クラウドソーシングプロトコルでは、3名のアノテーター間で著しい合意(Fleiss’ Kappa = 0.71)が得られ、制御された仮想ユーザーを用いた信頼性の高いデータ収集が可能であることが示された。
  • コピーメカニズムを備えたモデルは、それなしのモデルを上回る性能を示し、ルールテキストからのキーワードのコピーが回答生成と自然さの向上に寄与することが示唆された。
  • 最も優れたモデル(CM)は、背景知識が不要な状況でマクロ正解率0.619、BLEU-1 0.689を達成し、有望ではあるが完全ではない性能を示した。
  • 結果から、現在のモデルには深刻なギャップが存在することが浮き彫りになった。ルールの推論と外部知識の統合において、さらなる改善の余地が大きく、より優れた帰結推論および質問生成メカニズムの開発が今後の研究における必要不可欠であることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。