[论文解读] StreamingQA: A Benchmark for Adaptation to New Knowledge over Time in Question Answering Models
StreamingQA 引入了一个大规模、带时间戳的问答基准,使用14年新闻文章来评估问答模型随时间推移对新知识的适应能力。研究显示,增量微调相比完整微调可将计算成本降低95%,而半参数模型则从更新的语言模型中显著受益,并且其优势取决于命名实体的频率。
Knowledge and language understanding of models evaluated through question answering (QA) has been usually studied on static snapshots of knowledge, like Wikipedia. However, our world is dynamic, evolves over time, and our models' knowledge becomes outdated. To study how semi-parametric QA models and their underlying parametric language models (LMs) adapt to evolving knowledge, we construct a new large-scale dataset, StreamingQA, with human written and generated questions asked on a given date, to be answered from 14 years of time-stamped news articles. We evaluate our models quarterly as they read new articles not seen in pre-training. We show that parametric models can be updated without full retraining, while avoiding catastrophic forgetting. For semi-parametric models, adding new articles into the search space allows for rapid adaptation, however, models with an outdated underlying LM under-perform those with a retrained LM. For questions about higher-frequency named entities, parametric updates are particularly beneficial. In our dynamic world, the StreamingQA dataset enables a more realistic evaluation of QA models, and our experiments highlight several promising directions for future research.
研究动机与目标
- 为填补评估问答模型适应新知识并避免灾难性遗忘能力的空白。
- 创建一个对问题和知识来源均具备时间定位的基准,与 Wikipedia 等静态快照不同。
- 研究参数化和半参数化问答模型中增量微调与基于检索的适应策略的有效性。
- 评估模型在涉及相对时间引用(如“一周前”)以及不同命名实体频率的问题上的表现。
提出的方法
- 构建大规模数据集 StreamingQA,包含人工撰写和语言模型生成的问题,与2007–2020年期间的时间戳新闻文章配对。
- 为每个问题指定具体的问题日期,并提供三个参考答案和带有发布日期的证据文档。
- 在模型摄入预训练期间未见过的新文章时,每季度评估一次模型表现,模拟流式知识更新场景。
- 采用自动过滤机制,通过基于语言模型的问答验证、Google 搜索验证和命名实体约束,去除简单或低质量的生成问题。
- 对参数化模型实施增量微调,并评估其在近期和过去知识上的表现。
- 通过基于频率的分析,比较参数化与半参数化方法在高频与低频命名实体上的表现,揭示二者优势的互补性。
实验结果
研究问题
- RQ1参数化与半参数化问答模型在不发生灾难性遗忘的前提下,如何随时间推移适应新知识?
- RQ2与完整微调相比,对参数化语言模型进行增量微调能在多大程度上提升性能?
- RQ3命名实体的频率在多大程度上影响参数化与半参数化适应策略的表现?
- RQ4在流式问答设置中,模型能否有效处理相对时间引用(如“一周前”)?
- RQ5在半参数化基于检索的系统中,使用过时的语言模型会产生何种影响?
主要发现
- 与完整微调相比,增量微调将训练步骤减少了95%,同时避免了参数化模型中的灾难性遗忘。
- 使用更新语言模型的半参数化模型,即使在检索语料库中新增文章后,其表现也优于使用过时语言模型的模型。
- 参数化适应在涉及高频命名实体的问题上显著提升性能,而基于检索的方法在这些场景下表现较差。
- 半参数化适应在低频命名实体上更有效,因为检索噪声和歧义更少。
- 该基准揭示了互补优势:参数化更新有助于高频实体,而基于检索的更新有助于稀有实体。
- 该数据集使在具备问题和知识来源时间定位的真实世界动态环境中,对问答系统进行现实评估成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。