[論文レビュー] Learning to Explain: Answering Why-Questions via Rephrasing
本稿では、テキスト内の 'because' 従属節の依存構文解析から得られる自動収集済み現象-説明ペアを用いて学習することで、オープンドメインの『なぜ』質問に対して自然言語による説明を生成するシーケンス・ツー・シーケンスモデルを提案する。この手法は、人間による評価において流暢で妥当な説明を生成し、整理された知識ベースを必要とせずに、一貫性があり文脈に配慮した説明を生成する点でベースラインを上回る性能を示す。
Providing plausible responses to why questions is a challenging but critical goal for language based human-machine interaction. Explanations are challenging in that they require many different forms of abstract knowledge and reasoning. Previous work has either relied on human-curated structured knowledge bases or detailed domain representation to generate satisfactory explanations. They are also often limited to ranking pre-existing explanation choices. In our work, we contribute to the under-explored area of generating natural language explanations for general phenomena. We automatically collect large datasets of explanation-phenomenon pairs which allow us to train sequence-to-sequence models to generate natural language explanations. We compare different training strategies and evaluate their performance using both automatic scores and human ratings. We demonstrate that our strategy is sufficient to generate highly plausible explanations for general open-domain phenomena compared to other models trained on different datasets.
研究の動機と目的
- オープンドメインの『なぜ』質問に対して、自然で流暢で妥当な説明を生成する課題に取り組み、事前に用意された説明の順序付けにとどまらないこと。
- 既存のチャットボットデータセットにおけるデータスパarsityが、モデルが『なぜ』質問に効果的に応答できない原因となっているのを克服すること。
- 神経的シーケンス・ツー・シーケンスモデルを用いて、自動的に構築されたデータセットで学習する、スケーラブルでエンド・ツー・エンドの説明生成手法を開発すること。
- 『なぜ』質問を説明生成器の入力として使用可能な文形式に再構成することで、モデルが単一ラウンドの雑談チャットボットとして機能できるようにすること。
- 文法性、妥当性、有用性の観点から、自動指標と人間評価の両方を用いて生成された説明の質を評価すること。
提案手法
- Stanford CoreNLP を用いた依存構文解析により、'because' を含む文から現象-説明ペアを抽出し、S1(現象)と S2(説明)に分割する。
- 文脈(現象の直前5文)を収集し、<SEP> テンキーを用いて S1 と連結することで、モデルの入力シーケンスを構築する。
- モデルはシーケンス・ツー・シーケンスタスクとして学習する:C1,...,C5 <SEP> S1 を入力として与えたとき、S2 を説明として予測する。
- 独自のアルゴリズム(アルゴリズム1)により、『なぜ』質問を S1 形式の文に変換する。この際、依存構文解析から主語、助動詞、動詞の要素を抽出する。
- モデルはトランスフォーマーに基づくアーキテクチャ(L2E-Seq2Seq)を採用し、LSTMベースのモデルや他のデータセットで微調整された言語モデルと比較する。
- 人間評価は Amazon Mechanical Turk を通じて実施され、参加者は生成された説明の文法性、妥当性、有用性、関連性について評価する。
実験結果
リサーチクエスチョン
- RQ1神経的シーケンス・ツー・シーケンスモデルは、整理された知識ベースに依存せずに、オープンドメインの『なぜ』質問に対して流暢で妥当な自然言語説明を生成できるか?
- RQ2直前の5文の文脈を組み込むことで、生成された説明の主題的関連性と質が向上するか?
- RQ3自動抽出された 'because' 従属節ペアで学習したモデルは、人間による評価で妥当性が認められる説明を生成できるか?
- RQ4人間による説明の質と流暢さの観点から、提案手法の性能はベースラインと比べてどうか?
- RQ5モデルは、『なぜ』質問に応答する単一ラウンドの雑談チャットボットとして、どの程度適応可能か?
主な発見
- L2E-Seq2Seq モデルは、人間による評価で文法性スコア 0.738(95% CI: 0.70–0.77)を達成し、元の説明(0.684)を上回った。
- 全体的な妥当性に関しては、モデルは 0.543(95% CI: 0.50–0.59)を記録したが、元の説明(0.710)より低かったが、中立基準値 0.5 を上回っていた。
- 人間評価において、生成された説明は元の説明(0.696)よりも有用性が高かった(0.512)ことから、対話システムへの実用的導入の可能性が示された。
- 人間評価者によると、生成された説明は元の説明よりも文法的に正しいと評価されたため、妥当性スコアが低くても、流暢さが向上している可能性がある。
- 生成された文脈に配慮した自然な言い回しの説明を生成する点で、モデルはベースラインの言語モデル(例:LM-1B)や他のデータセットで学習したシーケンス・ツー・シーケンスモデルを上回った。
- 本研究は、'because' 従属節から自動収集された自己説明で学習することで、モデルが妥当な説明を生成できることを確認したが、人間並みの質にはまだ到達していない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。