Skip to main content
QUICK REVIEW

[论文解读] Towards Teachable Reasoning Systems: Using a Dynamic Memory of User Feedback for Continual System Improvement

Bhavana Dalvi, Oyvind Tafjord|arXiv (Cornell University)|Apr 27, 2022
Topic Modeling被引用 13
一句话总结

该论文提出 TeachMe,一种可教学的推理系统,通过动态存储用户反馈,持续改进问答性能而无需重新训练模型。通过将用户更正的事实整合到新查询的上下文中,系统能够覆盖模型的错误信念,在真实用户交互后,隐藏测试集上的性能提升超过15%,展示了通过用户反馈实现有效持续学习的能力。

ABSTRACT

Our goal is a teachable reasoning system for question-answering (QA), where a user can interact with faithful answer explanations, and correct its errors so that the system improves over time. Our approach is to augment a QA model with a dynamic memory of user feedback, containing user-supplied corrections to erroneous model beliefs that users identify during interaction. Retrievals from memory are used as additional context for QA, to help avoid previous mistakes in similar new situations - a novel application of memory-based continuous learning. With simulated feedback, we find that our system (called TeachMe) continually improves with time, and without model retraining, requiring feedback on only 25% of training examples to reach within 1% of the upper-bound (feedback on all examples). Similarly, in experiments with real users, we observe a similar trend, with performance improving by over 15% on a hidden test set after teaching. This suggests new opportunities for using frozen language models in an interactive setting where users can inspect, debug, and correct the model's beliefs, leading to improved system's performance over time.

研究动机与目标

  • 开发一种可教学的推理系统,使用户能够通过交互式反馈检查、调试并纠正模型信念。
  • 在不重新训练底层冻结语言模型的前提下,实现在时间维度上的持续系统改进。
  • 将用户提供的更正与模型内部信念相结合,实现系统性推理并避免错误。
  • 在真实交互环境中,使用模拟和真实用户反馈对方法进行评估。
  • 证明用户反馈可通过推理时的记忆检索被利用,以提升对未见问题的泛化能力。

提出的方法

  • 为冻结的问答模型增加一个动态记忆,用于存储用户提供的对错误模型信念的更正。
  • 在推理过程中,将记忆检索结果作为额外上下文,以覆盖不正确的推理路径。
  • 生成基于蕴含关系的推理链,使模型信念和错误对用户透明。
  • 允许用户识别并更正解释中的错误,且更正内容将存储在记忆中以供未来使用。
  • 应用检索增强生成(RAG)原则,但使用用户生成的事实而非静态知识源。
  • 维护一个持久的、运行时动态更新的记忆,使模型在不微调的情况下偏向于已更正的信念。

实验结果

研究问题

  • RQ1一种可教学的问答系统是否能通过用户反馈在不重新训练的情况下持续改进?
  • RQ2存储在动态记忆中的用户反馈在纠正模型错误并提升对未见问题的性能方面有多有效?
  • RQ3系统在推理时能多大程度上利用用户更正来避免重复过去的错误?
  • RQ4当仅使用部分反馈时,系统性能如何随用户反馈实例数量而变化,尤其是其可扩展性如何?
  • RQ5真实用户交互是否能带来在隐藏测试集上可度量且可泛化的系统性能提升?

主要发现

  • 在模拟反馈下,TeachMe 仅使用25%的黄金反馈标注,性能即接近上界,误差在1%以内,表现出极高的数据效率。
  • 在真实用户实验中,系统在用户对少量训练问题进行教学后,隐藏测试集上的性能提升了超过15%。
  • 系统在保持模型冻结的同时,通过从用户反馈中实时注入上下文,实现了持续改进。
  • 从记忆中检索用户更正的事实,能有效覆盖模型的错误信念,并提升对类似新问题的推理能力。
  • 该方法在模拟和真实世界环境中均表现出可行性,显示出在交互式、用户驱动的持续学习方面具有强大潜力。
  • 即使反馈稀疏,系统的性能增益仍能维持,表明关键误解可早期纠正,从而防止错误的级联传播。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。