Skip to main content
QUICK REVIEW

[論文レビュー] Conversational Question Reformulation via Sequence-to-Sequence Architectures and Pretrained Language Models

Sheng-Chieh Lin, Jheng-Hong Yang|arXiv (Cornell University)|Apr 4, 2020
Topic Modeling参考文献 22被引用数 36
ひとこと要約

本論文は、対話型質問リフォーム(CQR)をシーケンス・ツー・シーケンスモデルと事前学習済み言語モデルを用いて実証的に研究し、T5がCANARDとCAsTで最先端のBLEUを達成し、CANARDでは人間の性能に近づいている。

ABSTRACT

This paper presents an empirical study of conversational question reformulation (CQR) with sequence-to-sequence architectures and pretrained language models (PLMs). We leverage PLMs to address the strong token-to-token independence assumption made in the common objective, maximum likelihood estimation, for the CQR task. In CQR benchmarks of task-oriented dialogue systems, we evaluate fine-tuned PLMs on the recently-introduced CANARD dataset as an in-domain task and validate the models using data from the TREC 2019 CAsT Track as an out-domain task. Examining a variety of architectures with different numbers of parameters, we demonstrate that the recent text-to-text transfer transformer (T5) achieves the best results both on CANARD and CAsT with fewer parameters, compared to similar transformer architectures.

研究の動機と目的

  • 対話QAおよびタスク指向対話における共参照・省略の解決のため、文脈内で質問を書き直す必要性を動機付ける。
  • CQRのMLEのトークン対トークン独立性仮定を事前学習モデルが緩和できるかを調査する。
  • CANARD(ドメイン内)とCAsT(ドメイン外)で異なるPLMとS2Sアーキテクチャを評価し、優れた性能を示すものを特定する。

提案手法

  • CQRを現在の質問と対話履歴を入力として受け取り、書き直した質問を出力するシーケンス・ツー・シーケンス Taskとして定式化。
  • CANARDを用いて履歴と現在のクエリを結合したコンテキストで、LSTMベースのS2S、GPT-2、BERT、UniLM、T5などのモデルをファインチューニング。
  • BLEUを評価指標として、CANARDとCAsTの人間が書き直した参照と出力を比較。
  • グリーディ、ビーム探索(ビーム幅は最大10)、トップ-kサンプリングなどのデコーディング戦略を検討し、デコーディング感度を評価。
  • 再現性のためにモデルのパラメータ数と学習設定を報告。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み言語モデルは、CQRにおける純粋なMLEベースラインを超える対話型質問リフォームを改善できるか?
  • RQ2どのモデルアーキテクチャ(およびパラメータスケール)がCANARDとCAsTで文脈/履歴を最大限活用して質問を書き直すのに最適か?
  • RQ3デコーディング戦略は、CANARDとCAsTでBLEUで測定するCQR品質にどのように影響するか?

主な発見

  • T5-baseはGreedyデコードでCANARD (59.13) と CAsT (58.08) のベストBLEUを達成。
  • T5-baseとbeam search(width=10)でCAsTのBLEUは76.22に達し、CANARDの人間性能に近い(人間のBLEUは約59.92、モデルは58–60範囲)。
  • CANARDでは人間がモデルより優れており、Human at 59.92 BLEU、Raw at 33.84; 各種PLMはRawを上回る。例: UniLM-large at 57.39 (CANARD Dev) and 55.92 (CAsT Dev)。
  • GPT-2-mediumとBERT-largeもLSTMを上回り、GPT-2-mediumは CANARD Dev 52.63、CANARD Test 50.07; BERT-largeは CANARD Dev 55.34、CANARD Test 54.34。
  • UniLM-largeとT5-baseは、データセット全体で一貫して他のアーキテクチャを上回り、CQRにおけるtext-to-text転送モデルの利点を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。