Skip to main content
QUICK REVIEW

[論文レビュー] Question Generation by Transformers

Kettip Kriangchaivech, Artit Wangperawong|arXiv (Cornell University)|Sep 9, 2019
Topic Modeling参考文献 20被引用数 6
ひとこと要約

本稿では、Wikipediaの要約から自動的に質問を生成するためのトランスフォーマー基盤のシーケンス・トゥ・シーケンスモデルを提案する。SQuADの逆転データセットで学習された本モデルは、平均8語の質問を文法的に正しい形で生成するが、9.66の語誤り率(WER)は、SQuADの質問と比較して顕著な文法的乖離を示しており、質問の複雑さや質問の開始語の多様性に限界があることを反映している。

ABSTRACT

A machine learning model was developed to automatically generate questions from Wikipedia passages using transformers, an attention-based model eschewing the paradigm of existing recurrent neural networks (RNNs). The model was trained on the inverted Stanford Question Answering Dataset (SQuAD), which is a reading comprehension dataset consisting of 100,000+ questions posed by crowdworkers on a set of Wikipedia articles. After training, the question generation model is able to generate simple questions relevant to unseen passages and answers containing an average of 8 words per question. The word error rate (WER) was used as a metric to compare the similarity between SQuAD questions and the model-generated questions. Although the high average WER suggests that the questions generated differ from the original SQuAD questions, the questions generated are mostly grammatically correct and plausible in their own right.

研究の動機と目的

  • テンプレートフリーで、人為的介入を最小限に抑えた、RNNの代わりにトランスフォーマーを用いた質問生成システムの開発。
  • 教育者によるクイズやテスト作成の効率性とスケーラビリティを向上させるために、質問生成を自動化すること。
  • 手作業で作成したルールやテンプレートに依存せずに、文法的に正しいかつ文脈的に関連性のある質問を生成できるかどうかをモデルの能力として評価すること。
  • 語誤り率(WER)を用いた質問品質の診断と、質問タイプの分布におけるバイアスの特定。
  • 今後の改善策として、データ拡張と事前学習済み言語モデルの活用を検討し、質問の多様性と意味的正確性を向上させること。

提案手法

  • 本モデルは、再帰的ニューラルネットワーク(RNN)に代わって、エンコーダ・デコーダの注意メカニズムを備えたトランスフォーマー基盤のシーケンス・トゥ・シーケンスアーキテクチャを採用している。
  • 自己注意メカニズムはスケーリングされたドット積み注意を用いて実装され、$\text{Attention}(Q,K,V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d}}\right)V$ で表される。
  • 本モデルは、Wikipediaの要約から抽出された10万組以上の質問・回答ペアを含む、逆転SQuADデータセットで微調整されている。
  • 生成品質の向上と可変長シーケンスの処理のため、デコード段階でビームサーチとバケット化が用いられている。
  • h個のヘッドを用いたマルチヘッド注意により、モデルは並列で異なる表現部分空間に注目でき、文脈モデリングの精度が向上する。
  • 生成された質問とゴールスタンダードのSQuAD質問を比較するため、語誤り率(WER)を用いて評価されており、質問構造と最初の語の頻度についての追加分析も実施されている。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー基盤のモデルは、テンプレートや人為的ルールに依存せずに、文法的に正しいかつ文脈的に関連性のある質問を生成できるか?
  • RQ2RNNベースのモデルと比較して、トランスフォーマー基盤の質問生成モデルのトレーニング効率性と出力品質はどのように異なるか?
  • RQ3生成された質問は、SQuADにアノテートされた人間の質問と、意味的・文法的構造でどの程度一致するか?
  • RQ4生成された質問における質問タイプ(例:開始語の分布)に顕著なバイアスは存在するか?また、人間がアノテートした質問と比較するとどうなるか?
  • RQ5データ拡張と事前学習済み言語モデルを活用することで、生成された質問の多様性と意味的正確性をどのように向上させられるか?

主な発見

  • 生成された質問の平均長は8語であり、SQuADの平均12語と比較して著しく短く、質問が単純で詳細性に欠けていることを示している。
  • 生成された質問とSQuAD質問との間の平均語誤り率(WER)は9.66であり、文法的に正しいものの、顕著な文法的乖離が生じていることを示している。
  • 高いWERにもかかわらず、多くの生成質問は意味的に妥当で文脈に関連しており、例えば「by what means were scientists able to liquefy air?」に対して「what is the name of the process of water?」を生成するなど、文脈的整合性を保っている。
  • 本モデルは「what」で始まる質問の生成に強く偏っており、10種類の異なる開始語しか使用していないのに対し、SQuADでは21種類あるため、質問タイプの多様性に欠けていることが明らかになった。
  • WERが20以上の質問でさえも、正しい答えと文脈を反映しているが、しばしば質問語(例:「who」対「what」)が異なるため、構造的違いがあるものの意味的類似性が保たれている。
  • 本研究では、BLEU や ROUGE といった指標が意味的類似性を十分に捉えていない可能性を示唆し、より信頼性の高い評価方法として、SQuADの質問・回答モデルを用いて答えの一致度を評価することを提案している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。