Skip to main content
QUICK REVIEW

[論文レビュー] StreamingQA: A Benchmark for Adaptation to New Knowledge over Time in Question Answering Models

Adam Liška, Tomáš Kočiský|arXiv (Cornell University)|May 23, 2022
Topic Modeling被引用数 16
ひとこと要約

StreamingQAは、14年間にわたるニュース記事を用いたタイムスタンプ付きの大規模な質疑応答ベンチマークを導入し、QAモデルが時間の経過とともに新しい知識にどのように適応するかを評価する。本研究では、完全再訓練と比較して計算コストを95%削減するインクリメンタルファインチューニングの有効性を示しており、半パラメトリックモデルは更新された言語モデルから著しく利益を受ける。また、名前付きエンティティの頻度に応じて、両アプローチに補完的な強みが存在する。

ABSTRACT

Knowledge and language understanding of models evaluated through question answering (QA) has been usually studied on static snapshots of knowledge, like Wikipedia. However, our world is dynamic, evolves over time, and our models' knowledge becomes outdated. To study how semi-parametric QA models and their underlying parametric language models (LMs) adapt to evolving knowledge, we construct a new large-scale dataset, StreamingQA, with human written and generated questions asked on a given date, to be answered from 14 years of time-stamped news articles. We evaluate our models quarterly as they read new articles not seen in pre-training. We show that parametric models can be updated without full retraining, while avoiding catastrophic forgetting. For semi-parametric models, adding new articles into the search space allows for rapid adaptation, however, models with an outdated underlying LM under-perform those with a retrained LM. For questions about higher-frequency named entities, parametric updates are particularly beneficial. In our dynamic world, the StreamingQA dataset enables a more realistic evaluation of QA models, and our experiments highlight several promising directions for future research.

研究の動機と目的

  • QAモデルが新しい知識に適応する能力と、時間の経過による忘却を避ける能力を評価するというギャップを埋める。
  • Wikipediaのような静的スナップショットとは異なり、質問および知識ソースの両方に時間的位置づけ(タイムスタンプ)を持つベンチマークを構築する。
  • パラメトリックおよび半パラメトリックQAモデルにおけるインクリメンタルファインチューニングとリtrievalベースの適応の有効性を調査する。
  • 相対的時間表現(例:「1週間前」)を含む質問におけるモデルのパフォーマンスを評価する。

提案手法

  • 2007年から2020年までのタイムスタンプ付きニュース記事と、人間が作成したおよび言語モデルで生成された質問をペアにした大規模データセット、StreamingQAを構築する。
  • 各質問に明確な質問日を付与し、発行日が記録された3つの参考回答および証拠文書を提供する。
  • 事前学習中に見られなかった新しい記事を段階的に取り込むことで、四半期ごとにモデルを評価し、ストリーミング知識更新シナリオをシミュレートする。
  • LMベースのQA検証、Google検索による検証、名前付きエンティティの制約を用いて、自動フィルタリングを実施し、自明または低品質な生成質問を除外する。
  • パラメトリックモデルに対してインクリメンタルファインチューニングを実装し、最近の知識と過去の知識の両方でパフォーマンスを評価する。
  • 頻度に基づく分析を用いて、高頻度と低頻度の名前付きエンティティにおけるパフォーマンスを比較し、パラメトリックおよび半パラメトリックアプローチの補完的強みを明らかにする。

実験結果

リサーチクエスチョン

  • RQ1パラメトリックおよび半パラメトリックQAモデルは、災難的忘却を避けて、時間の経過とともに新しい知識にどのように適応するか?
  • RQ2パラメトリック言語モデルのインクリメンタルファインチューニングは、完全再訓練と比較して、どの程度パフォーマンスを向上させるか?
  • RQ3名前付きエンティティの頻度は、パラメトリック対比して半パラメトリックな適応戦略のパフォーマンスにどのように影響するか?
  • RQ4ストリーミングQA設定において、相対的時間表現(例:「1週間前」)を効果的に処理できるか?
  • RQ5半パラメトリックリtrievalベースのシステムでは、古くなった言語モデルがどのような影響を及ぼすか?

主な発見

  • インクリメンタルファインチューニングは、完全再訓練と比較して学習ステップを95%削減し、パラメトリックモデルにおける災難的忘却を回避する。
  • 更新された言語モデルを搭載した半パラメトリックモデルは、古くなった言語モデルを搭載したモデルでさえも、新しい記事がリトリーブコーパスに追加された場合でも優れたパフォーマンスを示す。
  • パラメトリック適応は、リトリーブベースの手法が苦手とする高頻度の名前付きエンティティを含む質問において、顕著なパフォーマンス向上を示す。
  • 低頻度の名前付きエンティティでは、リトリーブのノイズや曖昧さが低減されるため、半パラメトリック適応がより効果的である。
  • ベンチマークにより、補完的強みが明らかになった:パラメトリック更新は頻度の高いエンティティに有効であり、リトリーブベースの更新は希少なエンティティに有効である。
  • このデータセットにより、質問および知識ソースの両方に時間的位置づけを持つ、動的で現実世界に即したQAシステムの評価が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。