[论文解读] A Large Language Model Approach to Educational Survey Feedback Analysis
本文提出了一种零样本、基于提示的工作流,利用 GPT-4 和 GPT-3.5 自动化教育调查反馈分析,将分类、信息抽取、情感分析和主题分析视为自然语言处理任务。该方法在无需微调的情况下,于真实世界生物医学课程调查数据上实现了人类水平的性能,展示了大型语言模型作为可扩展、可组合的工具在课程评估与改进中的潜力。
This paper assesses the potential for the large language models (LLMs) GPT-4 and GPT-3.5 to aid in deriving insight from education feedback surveys. Exploration of LLM use cases in education has focused on teaching and learning, with less exploration of capabilities in education feedback analysis. Survey analysis in education involves goals such as finding gaps in curricula or evaluating teachers, often requiring time-consuming manual processing of textual responses. LLMs have the potential to provide a flexible means of achieving these goals without specialized machine learning models or fine-tuning. We demonstrate a versatile approach to such goals by treating them as sequences of natural language processing (NLP) tasks including classification (multi-label, multi-class, and binary), extraction, thematic analysis, and sentiment analysis, each performed by LLM. We apply these workflows to a real-world dataset of 2500 end-of-course survey comments from biomedical science courses, and evaluate a zero-shot approach (i.e., requiring no examples or labeled training data) across all tasks, reflecting education settings, where labeled data is often scarce. By applying effective prompting practices, we achieve human-level performance on multiple tasks with GPT-4, enabling workflows necessary to achieve typical goals. We also show the potential of inspecting LLMs' chain-of-thought (CoT) reasoning for providing insight that may foster confidence in practice. Moreover, this study features development of a versatile set of classification categories, suitable for various course types (online, hybrid, or in-person) and amenable to customization. Our results suggest that LLMs can be used to derive a range of insights from survey text.
研究动机与目标
- 探索使用大型语言模型(LLMs)如 GPT-4 和 GPT-3.5 在无需微调或标注数据的情况下,自动化分析教育调查反馈的定性数据的可行性。
- 评估零样本提示是否可在教育场景中实现多标签分类、情感分析和信息抽取等多样化自然语言处理任务的人类水平性能。
- 评估链式思维推理在大型语言模型中提升可解释性和用户对调查反馈分析结果信心的效果。
- 开发一种可自定义、可组合的基于 LLM 的自然语言处理工作流框架,适用于不同课程形式(线上、线下、混合式)。
- 证明 LLM 可作为人工标注或专用机器学习模型在教育反馈分析中的可扩展、灵活的替代方案。
提出的方法
- 本研究采用零样本提示方法,将教育调查分析视为一系列自然语言处理任务,包括多标签分类、二分类、情感分析和命名实体抽取。
- 开发了一个包含 22 个分类类别的自定义分类体系,涵盖生物医学科学课程的内容、授课方式、教师表现及后勤管理等方面。
- 通过少量示例和链式思维技术精心设计提示,以从 GPT-4 和 GPT-3.5 中获取结构化、可靠的响应。
- 使用人工标注的黄金标准对来自线上生物医学科学课程的 2500 条真实课程结束调查评论进行性能评估。
- 分析链式思维推理,以评估其与正确分类结果的一致性。
- 在多个任务上测试该工作流,结果与人工标注者及基线模型(如 RoBERTa 和 SetFit)进行比较。

实验结果
研究问题
- RQ1GPT-4 在零样本提示下能否在教育调查反馈的多标签分类、情感分析和信息抽取任务中实现人类水平的性能?
- RQ2链式思维推理在多大程度上能提升 LLM 生成的调查分析结果的可解释性和可靠性?
- RQ3是否可以将单一、可重用的基于 LLM 的工作流应用于多种课程类型(线上、混合式、线下),且仅需极少配置调整?
- RQ4在无需微调的情况下,GPT-4 的性能与 GPT-3.5 及专用模型(如 RoBERTa、SetFit)在教育反馈分析中的表现相比如何?
- RQ5LLM 在多大程度上可减少对人工标注或微调模型在教育反馈分析中的依赖?
主要发现
- GPT-4 仅通过零样本提示,就在多标签分类(F1 得分为 0.85)、情感分析(F1 得分为 0.87)和信息抽取任务中实现了人类水平的性能。
- GPT-4 的链式思维推理展现出一致且合乎逻辑的推理过程,显著提升了模型输出的可解释性与用户信心。
- GPT-3.5 在各项任务中表现较低但仍有实际意义,尤其在情感分析和二分类任务中表现良好,尽管未达到 GPT-4 的准确率。
- 基于 LLM 的工作流成功组合了多个任务,实现了无需模型微调或领域特定数据的端到端调查反馈分析。
- 本研究提出的 22 个可自定义类别的分类体系在多种课程形式中均表现有效,且通过少量提示调整即可适配不同教育场景。
- 结果表明,LLM(尤其是 GPT-4)可作为人工或专用模型方法在教育反馈分析中的可扩展、灵活且可解释的替代方案。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。