[论文解读] AI-TA: Towards an Intelligent Question-Answer Teaching Assistant using Open-Source LLMs
本文介绍了 AI-TA,这是一个基于开源、注重隐私的问答教学助教系统,适用于在线教育平台,利用检索增强生成(RAG)、监督微调(SFT)和直接偏好优化(DPO)技术,在 LLaMA-2 模型基础上提升答案质量。在计算机科学导论课程的 Piazza 数据集上,该系统实现了答案质量 30% 的提升,展现出与人类评估高度一致的结果,并在 BertScore 等自动化指标上表现优于基线模型。
Responding to the thousands of student questions on online QA platforms each semester has a considerable human cost, particularly in computing courses with rapidly growing enrollments. To address the challenges of scalable and intelligent question-answering (QA), we introduce an innovative solution that leverages open-source Large Language Models (LLMs) from the LLaMA-2 family to ensure data privacy. Our approach combines augmentation techniques such as retrieval augmented generation (RAG), supervised fine-tuning (SFT), and learning from human preferences data using Direct Preference Optimization (DPO). Through extensive experimentation on a Piazza dataset from an introductory CS course, comprising 10,000 QA pairs and 1,500 pairs of preference data, we demonstrate a significant 30% improvement in the quality of answers, with RAG being a particularly impactful addition. Our contributions include the development of a novel architecture for educational QA, extensive evaluations of LLM performance utilizing both human assessments and LLM-based metrics, and insights into the challenges and future directions of educational data processing. This work paves the way for the development of AI-TA, an intelligent QA assistant customizable for courses with an online QA platform
研究动机与目标
- 为解决大规模计算课程中,在线问答平台需应对成千上万学生提问所带来的高昂人力成本问题。
- 开发一种可扩展、注重隐私的教育问答系统,采用开源大语言模型,而非第三方专有模型。
- 通过检索增强生成、监督微调和基于偏好的优化相结合的方式,提升答案质量。
- 采用人工标注评分标准和大语言模型评估相结合的方式评估模型性能,确保与人类判断保持一致。
- 提供可自定义、可扩展的端到端流程,支持在各类在线问答平台课程中部署智能教学助教。
提出的方法
- 该流程整合了基于课程资料的检索增强生成(RAG),以确保答案基于相关教学内容。
- 在 10,000 个 Piazza 问答对上应用监督微调(SFT),使大语言模型更好地匹配课程特定的语言和内容。
- 采用直接偏好优化(DPO)作为强化学习人类反馈(RLHF)的轻量化替代方案,基于 1,500 组偏好对对模型进行微调,以提升响应质量。
- 基础模型选用 LLaMA-2,因其性能优异且为开源模型,有助于保障数据隐私。
- 评估采用 GPT-4 作为裁判模型,同时结合人工标注的评分标准,评估答案的实用性、准确性和整体质量。
- 对基于大语言模型的评估、人工评估和自动化评估(BertScore)指标之间的相关性进行分析,以验证其一致性。

实验结果
研究问题
- RQ1像 LLaMA-2 这样的开源大语言模型,是否可以通过 RAG、SFT 和 DPO 有效微调并增强,从而生成高质量的教育问答响应?
- RQ2在真实教育问答数据上,RAG、SFT 和 DPO 的组合相较于基线模型,在答案质量方面表现如何?
- RQ3在教育问答场景中,基于大语言模型的评估与人工标注的质量指标之间相关性如何?
- RQ4BertScore 在衡量教育问答响应质量方面,与人工评估和大语言模型评估相比表现如何?
- RQ5在使用大语言模型处理和评估教育问答数据时,面临的主要挑战和局限性是什么?
主要发现
- 所提出的流程相比基线 LLaMA-2 模型,将答案质量提升了 30%,其中 RAG 是影响最显著的组件。
- 人工评估显示,人工标注的整体质量与基于 GPT-4 的大语言模型评估之间存在中等到强相关性(r = 0.662)。
- 基于大语言模型的评估与人工判断的一致性高于 BertScore,后者与人工评分的相关性较弱(r = 0.383)。
- 混淆矩阵分析表明,大语言模型评估通常比人工评分者更宽松,在多数情况下给出更高的评分。
- 基于 DPO 的偏好优化被证明是 RLHF 的有效轻量化替代方案,在无需复杂强化学习设置的情况下提升了响应质量。
- 通过 RAG 集成课程资料,显著提升了生成答案的事实准确性与内容相关性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。