Skip to main content
QUICK REVIEW

[论文解读] Robosourcing Educational Resources -- Leveraging Large Language Models for Learnersourcing

Paul Denny, Sami Sarsa|arXiv (Cornell University)|Nov 9, 2022
Natural Language Processing Techniques被引用 18
一句话总结

本文提出了一种名为robosourcing的混合方法,该方法利用大型语言模型(LLMs),如OpenAI Codex,生成教育编程练习,学习者提供输入提示并评估输出。结果表明,约33%的LLM生成的练习可直接用于教学,显著降低了人工工作量,同时保持了高质量,从而解决了learnersourcing中的动机和质量挑战。

ABSTRACT

In this article, we introduce and evaluate the concept of robosourcing for creating educational content. Robosourcing lies in the intersection of crowdsourcing and large language models, where instead of a crowd of humans, requests to large language models replace some of the work traditionally performed by the crowd. Robosourcing includes a human-in-the-loop to provide priming (input) as well as to evaluate and potentially adjust the generated artefacts; these evaluations could also be used to improve the large language models. We propose a system to outline the robosourcing process. We further study the feasibility of robosourcing in the context of education by conducting an evaluation of robosourced and programming exercises, generated using OpenAI Codex. Our results suggest that robosourcing could significantly reduce human effort in creating diverse educational content while maintaining quality similar to human-created content.

研究动机与目标

  • 通过将大型语言模型(LLMs)整合到流程中,解决learnersourcing中学习者参与度低和内容质量不一致的问题。
  • 评估LLM生成的教育内容是否可作为学习者的可行起点,从而减轻内容创作负担。
  • 研究在learnersourcing中使用LLM作为支架工具的可行性,将学习者的角色从内容创作者转变为内容评估者。
  • 评估LLM生成的编程练习在教育环境中的质量、新颖性和可用性。
  • 探索人类评估反馈是否可用于改进LLM在教育内容生成方面的表现。

提出的方法

  • 利用OpenAI Codex作为LLM,基于学习者提供的自然语言提示生成编程练习。
  • 使用结构化提示(如主题、概念、任务描述)引导LLM生成特定领域的练习。
  • 采用人机协同模型,学习者根据预设标准评估生成的练习在正确性、清晰度和可用性方面的表现。
  • 应用自动化测试验证生成代码的功能正确性,确保可靠性。
  • 通过Google搜索评估练习的新颖性,确认其未复制自现有资源。
  • 收集关于内容质量和练习描述中潜在偏见的反馈。

实验结果

研究问题

  • RQ1像OpenAI Codex这样的LLM能否生成足够高质量的编程练习,以适用于教育场景?
  • RQ2学习者在多大程度上认为robosourced练习适合评估和修改?
  • RQ3LLM生成练习的质量和新颖性与人工创建的内容相比如何?
  • RQ4使用LLM对学习者在内容创作任务中的参与度和投入度有何影响?
  • RQ5人类对LLM生成内容的评估反馈能否用于改进LLM本身?

主要发现

  • 约三分之一(33%)的LLM生成的编程练习可直接用于教学,满足所有评估标准。
  • 超过90%的生成练习经Google搜索确认为原创,表明与现有内容的重复率极低。
  • 练习在主题和概念上具有多样性,例如主题如“音乐”,概念如“类”、“列表”和“条件语句”均可通过提示工程轻松调整。
  • 学习者能够高效地评估和修改练习,表明从内容创作转向内容筛选的角色转变是可行且有效的。
  • 生成的练习中未检测到不当内容或个人身份信息,但问题描述中观察到性别偏见(例如,男性名字更常见)。
  • 人类评估的反馈可能用于微调LLM,以提升其在教育内容生成方面的表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。