Skip to main content
QUICK REVIEW

[论文解读] Beyond Generating Code: Evaluating GPT on a Data Visualization Course

Zhutian Chen, Chenyang Zhang|arXiv (Cornell University)|Jun 5, 2023
Data Analysis with R被引用 5
一句话总结

本研究评估了 GPT-3.5 和 GPT-4 在哈佛大学 CS171 数据可视化课程中的表现,展示了其在数据清洗、SVG 可视化解读、基于 JavaScript 的交互操作以及洞察传达方面的能力——在测验和家庭作业中取得了 80% 的成绩,人类评分员对 AI 与人类作品的区分准确率为 70%。

ABSTRACT

This paper presents an empirical evaluation of the performance of the Generative Pre-trained Transformer (GPT) model in Harvard's CS171 data visualization course. While previous studies have focused on GPT's ability to generate code for visualizations, this study goes beyond code generation to evaluate GPT's abilities in various visualization tasks, such as data interpretation, visualization design, visual data exploration, and insight communication. The evaluation utilized GPT-3.5 and GPT-4 to complete assignments of CS171, and included a quantitative assessment based on the established course rubrics, a qualitative analysis informed by the feedback of three experienced graders, and an exploratory study of GPT's capabilities in completing border visualization tasks. Findings show that GPT-4 scored 80% on quizzes and homework, and TFs could distinguish between GPT- and human-generated homework with 70% accuracy. The study also demonstrates GPT's potential in completing various visualization tasks, such as data cleanup, interaction with visualizations, and insight communication. The paper concludes by discussing the strengths and limitations of GPT in data visualization, potential avenues for incorporating GPT in broader visualization tasks, and the need to redesign visualization education.

研究动机与目标

  • 评估 GPT 在代码生成之外的数据可视化任务中的能力,例如数据解释、设计、探索和洞察传达。
  • 评估 GPT-3.5 和 GPT-4 在哈佛大学 CS171 严谨的数据可视化课程真实作业中的表现。
  • 探究将大型语言模型作为可视化教育助手的可行性及其对教学与学习的潜在影响。
  • 识别 GPT 在可视化任务中的优势与局限,特别是在上下文感知推理和用户交互方面。
  • 通过探索 AI 工具如何融入或重构课程体系,为可视化教育的重新设计提供建议。

提出的方法

  • 通过 OpenAI API 使用 GPT-3.5 和 GPT-4 完成哈佛大学 CS171 数据可视化课程的作业,未进行专门的提示工程。
  • 使用课程既定的评分标准对模型输出进行定量评估,涵盖测验和家庭作业。
  • 通过三位前 CS171 教学助教对混合提交内容(AI 与人类作品)进行评分并提供反馈,开展定性分析。
  • 开展探索性研究,评估 GPT 处理数据清洗、SVG 可视化读取、JavaScript 事件分发以及叙事可视化创建等任务的能力。
  • 将 GPT 生成的输出与高质量的学生作品进行对比,评估其在感知差异和表现水平上的异同。
  • 分析模型在视觉数据解释、基于网页的可视化交互以及解释性洞察生成等任务中的行为表现。

实验结果

研究问题

  • RQ1GPT-4 在代码生成之外的数据可视化任务(如数据清洗、可视化解读和洞察传达)中能表现出多大程度的能力?
  • RQ2GPT 在 CS171 作业中的表现与人类学生相比如何,从定量和定性两个维度来看?
  • RQ3经验丰富的评分员能否可靠地区分 GPT 生成与人类生成的可视化作业?
  • RQ4GPT 在教育环境中处理复杂、多步骤可视化任务时的主要优势与局限是什么?
  • RQ5像 GPT 这类大型语言模型的整合将如何重塑数据可视化教育的未来以及课程设计?

主要发现

  • GPT-4 在哈佛大学 CS171 数据可视化课程的测验和家庭作业中取得了 80% 的成绩,表明其在核心可视化能力方面表现优异。
  • 教学助教对 GPT 生成与人类生成的家庭作业的区分准确率为 70%,表明存在可检测的风格或结构差异。
  • GPT 展现出清洗和探索 CSV 数据集的能力,表明其在基础数据处理任务中具备胜任力。
  • GPT 能够读取并解释 SVG 格式的可视化内容,并通过分发 JavaScript 事件模拟交互,显示出其在基于网页的可视化理解能力。
  • GPT 能够成功创建解释性和叙事性可视化以传达数据洞察,凸显其在洞察传达与故事叙述方面的潜力。
  • 研究发现,GPT 的局限性包括输出不稳定需多次重试,以及在管理多个代码文件方面存在困难,这限制了其在大规模系统中的应用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。