Skip to main content
QUICK REVIEW

[论文解读] Enhancing textual textbook question answering with large language models and retrieval augmented generation

Hessa Abdulrahman Alawwad, Areej Alhothali|arXiv (Cornell University)|Feb 5, 2024
Topic Modeling被引用 4
一句话总结

本文提出了一种在 Llama-2 上微调的检索增强生成(RAG)框架,以提升教科书问答(TQA)性能,特别针对关键概念跨越多个课程的“跨领域”问题。通过从向量数据库中检索相关主题,并将其与完整课程上下文结合,该模型在测试集上针对非图表类多选题实现了相较于未微调基线 Llama-2 的 9.84% 准确率提升。

ABSTRACT

Textbook question answering (TQA) is a challenging task in artificial intelligence due to the complex nature of context needed to answer complex questions. Although previous research has improved the task, there are still some limitations in textual TQA, including weak reasoning and inability to capture contextual information in the lengthy context. We propose a framework (PLRTQA) that incorporates the retrieval augmented generation (RAG) technique to handle the out-of-domain scenario where concepts are spread across different lessons, and utilize transfer learning to handle the long context and enhance reasoning abilities. Our architecture outperforms the baseline, achieving an accuracy improvement of 4. 12% in the validation set and 9. 84% in the test set for textual multiple-choice questions. While this paper focuses on solving challenges in the textual TQA, It provides a foundation for future work in multimodal TQA where the visual components are integrated to address more complex educational scenarios. Code: https://github.com/hessaAlawwad/PLR-TQA

研究动机与目标

  • 解决教科书问答中的“跨领域”问题,即相关信息分散在多个课程中。
  • 利用大语言模型(LLMs)提升长篇复杂教科书段落在上下文理解与推理方面的能力。
  • 通过检索增强生成(RAG)和监督微调,提升 CK12-QA 数据集中多选题问答的准确率。
  • 评估在长上下文 TQA 场景下,RAG 是否结合重排序对模型性能的影响。

提出的方法

  • 在 CK12-QA 数据集上通过监督微调(SFT)对 Llama-2 进行微调,以适应教科书问答任务。
  • 构建了使用向量数据库存储课程主题嵌入的检索增强生成(RAG)流水线。
  • 使用密集向量相似度(点积)从整个数据集中检索与每个问题相关的主题,将上下文扩展至问题来源课程之外。
  • 将完整课程和检索到的主题共同作为上下文整合进 LLM 提示中,以提升答案生成质量。
  • 应用重排序机制以优化检索到的主题,旨在提高相关性并减少噪声。
  • 通过非图表类多选题在验证集和测试集上的准确率评估模型性能。

实验结果

研究问题

  • RQ1当概念跨越多个课程时,检索增强生成(RAG)是否能提升 LLM 在教科书问答任务中的性能?
  • RQ2在长上下文 TQA 任务中,从其他课程中检索主题如何影响 LLM 的推理能力和准确率?
  • RQ3在 RAG 中使用重排序模块是否会导致模型性能提升或下降,因可能引入无关上下文?
  • RQ4与基础模型相比,对 Llama-2 进行监督微调在特定领域教科书问答任务中的性能提升程度如何?

主要发现

  • 基线 Llama-2 模型在验证集上对所有文本问题的准确率仅为 38.09%,在测试集上为 38.54%,表明其在 TQA 任务上的零样本性能极差。
  • 在不使用重排序的情况下集成 RAG,准确率提升至验证集 83.58% 和测试集 83.80%,显示出显著的性能提升。
  • 结合完整课程和检索主题的 RAG 方法在验证集上达到 83.78% 的准确率,在测试集上为 81.73%,测试集性能轻微下降,归因于上下文窗口饱和。
  • 引入重排序后的主题后,性能下降至验证集 80.74% 和测试集 79.22%,表明噪声或无关的检索内容可能损害模型推理。
  • 所提出的 RAG 增强型微调 Llama-2 模型相较于基线 Llama-2,在非图表类多选题上实现了验证集 4.12% 的准确率提升和测试集 9.84% 的准确率提升。
  • 分析显示,仅有 44% 的问题检索到了其正确课程的主题,即使经过重排序,也只有 52.43% 的问题成功从正确课程中检索到主题,凸显了在跨领域场景中使用 RAG 的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。