[论文解读] Towards Mitigating ChatGPT's Negative Impact on Education: Optimizing Question Design through Bloom's Taxonomy
本文提出一种基于遗传优化的进化算法,用于选择Bloom分类法关键词,生成ChatGPT回答时信心度较低的编程问题。通过针对高阶认知技能(如分析、评价、创造),该方法将ChatGPT的平均信心度从95%降低至45%,并生成信心度为0%的问题,帮助教育工作者设计促进批判性思维、减少对AI依赖的评估题目。
The popularity of generative text AI tools in answering questions has led to concerns regarding their potential negative impact on students' academic performance and the challenges that educators face in evaluating student learning. To address these concerns, this paper introduces an evolutionary approach that aims to identify the best set of Bloom's taxonomy keywords to generate questions that these tools have low confidence in answering. The effectiveness of this approach is evaluated through a case study that uses questions from a Data Structures and Representation course being taught at the University of New South Wales in Canberra, Australia. The results demonstrate that the optimization algorithm is able to find keywords from different cognitive levels to create questions that ChatGPT has low confidence in answering. This study is a step forward to offer valuable insights for educators seeking to create more effective questions that promote critical thinking among students.
研究动机与目标
- 为应对生成式AI工具(如ChatGPT)因导致学生过度依赖AI生成答案而对学习和评估完整性构成威胁的日益增长的担忧。
- 识别特定的Bloom分类法关键词组合,以降低AI在回答教育类问题(尤其是编程课程)时的信心度。
- 开发一种进化优化方法,系统性地演化问题变体,以挑战AI的推理能力。
- 通过最小化AI干扰,支持教育工作者设计促进深度学习和批判性思维的评估。
- 验证经优化的问题所生成的AI答案不仅信心度较低,而且经常错误或不完整。
提出的方法
- 使用基于遗传算法(GA)的进化算法,演化代表Bloom分类法关键词集合的染色体。
- 每个染色体通过生成式AI工具(如ChatGPT)生成新的问题变体,AI在回答该新问题时的信心得分作为需最小化的适应度函数。
- 算法在多代中应用选择、交叉和变异操作,以演化出使AI信心度最低的关键词组合。
- 通过避免暴力枚举,聚焦于在不同认知层级上智能演化关键词集合,从而优化搜索空间。
- 该方法在新南威尔士大学坎培拉分校的数据结构与表示课程的真实编程问题上进行了评估。
- 由课程讲师人工验证优化后问题的答案,以评估其正确性和完整性,确保暴露AI的局限性。
实验结果
研究问题
- RQ1进化算法能否识别出显著降低ChatGPT回答编程问题信心度的Bloom分类法关键词特定组合?
- RQ2此类关键词组合在多大程度上能挑战生成式AI模型(如ChatGPT)的推理能力和回答质量?
- RQ3使用优化关键词集生成的问题是否会导致AI回答错误或不完整,即使其信心度较低?
- RQ4该方法能否用于设计对AI生成答案不敏感的评估,同时促进高阶思维?
- RQ5不同认知层级(如分析、评价、创造)在问题设计中组合使用时,如何有效降低AI信心度?
主要发现
- 优化算法成功将ChatGPT在测试集上回答问题的平均信心度从95%降低至45%。
- 对于若干问题,算法生成的变体使ChatGPT的信心度降至0%,表明其完全无法确定地作答。
- 表现最佳的关键词组合包括高阶认知动词,如“分析”、“评价”、“检查”和“对比”,通常来自Bloom分类法的第4–6级。
- 人工验证显示,即使信心度较高,AI对优化后问题的回答也经常错误、不完整或过于笼统。
- 算法识别出有效的关键词对,如“分析和设计”或“开发和区分”,显著挑战了AI在编程任务中的推理能力。
- 结果表明,战略性地使用多样化的Bloom分类法关键词可有效干扰基于AI的答案生成,提升评估的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。