Skip to main content
QUICK REVIEW

[论文解读] Brave new world: Artificial Intelligence in teaching and learning

Adrian Groza, Anca Marginean|arXiv (Cornell University)|Sep 27, 2023
Online Learning and AnalyticsComputer Science被引用 3
一句话总结

本文探讨了大型语言模型(LLMs)如ChatGPT和BARD在高等教育中的整合,主张制定机构级人工智能政策以减轻抄袭、错误信息和偏见等风险。研究显示,LLMs通过偏爱能够访问先进模型的富裕学生,加剧了现有不平等现象;当前AI工具常生成幻觉或事实性错误内容,因此教学与评估中亟需提升批判性素养并加强机构监督。

ABSTRACT

We exemplify how Large Language Models are used in both teaching and learning. We also discuss the AI incidents that have already occurred in the education domain, and we argue for the urgent need to introduce AI policies in universities and for the ongoing strategies to regulate AI. Regarding policy for AI, our view is that each institution should have a policy for AI in teaching and learning. This is important from at least twofolds: (i) to raise awareness on the numerous educational tools that can both positively and negatively affect education; (ii) to minimise the risk of AI incidents in education.

研究动机与目标

  • 分析大型语言模型(LLMs)对高等教育教与学的当前及潜在影响。
  • 突出教育领域中人工智能滥用的真实案例,包括抄袭、错误信息和虚构内容。
  • 论证制定机构级人工智能政策以规范AI使用、降低学术环境中风险的必要性。
  • 考察LLMs如何加剧教育不平等,特别是高收入与低收入学生之间在先进模型(如GPT-4)获取上的差距。
  • 提升对LLM局限性的批判性认知,并强调教育者需指导学生区分AI生成内容与人类生成内容的必要性。

提出的方法

  • 分析来自公共数据库和案例研究的教育领域已记录的AI事件,包括BARD生成的虚假法律引用和错误信息。
  • 使用真实场景的提示,评估LLMs在测验生成、论文写作和演示文稿创建等教育任务中的表现。
  • 审查现有的AI监管框架,包括欧盟《人工智能法案》和拟议的全球人工智能机构,以评估其在教育领域的适用性。
  • 研究LLMs中的“输入平均,输出平均”现象,即模型输出质量反映训练数据质量,导致输出平庸化。
  • 评估基于AI的评估工具(如E-rater和Turnitin的AI检测)的局限性,包括误报率及种族/性别偏见。
  • 提出自下而上的AI生态教育政策框架,并倡导自上而下的监管策略,以确保教育领域AI使用的问责制与透明度。

实验结果

研究问题

  • RQ1大型语言模型目前在教学与学习中如何被使用?其主要优势与风险是什么?
  • RQ2教育领域中最严重的AI事件有哪些?这些事件揭示了LLMs的哪些局限性与危险?
  • RQ3LLMs在多大程度上加剧了教育不平等,特别是在GPT-4等先进模型的获取方面?
  • RQ4基于AI的评估工具(如E-rater和Turnitin的AI检测器)在多大程度上会产生偏见或不准确的结果?
  • RQ5为确保高等教育中AI的负责任且公平使用,需要哪些机构政策与教育策略?

主要发现

  • 如ChatGPT和BARD等LLMs已被学生用于生成论文、测验和演示文稿,常导致内容平庸、缺乏创造力,带有明显的‘GPT风味’。
  • 使用LLMs的学生中约50%可能获得中等或及格水平的成绩,表明LLMs对低技能学习者更有利,而非高成就者。
  • 如生成虚假法律引用或错误信息(例如BARD生成大屠杀否认言论)等事件表明,LLMs可能生成看似合理但虚假的内容。
  • 基于AI的作文评分工具(如E-rater)已被证实会为胡言乱语文本打高分,表明自动化评估系统存在系统性缺陷。
  • 已记录到AI评估工具中的偏见,包括对华裔学生评分偏高、对非裔美国学生评分偏低,反映出历史数据偏见的影响。
  • 尽管具备透明度功能,用户通常仍 unaware 自己的聊天记录可能被用于模型再训练,尤其在共享私人数据时,引发隐私担忧。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。