Skip to main content
QUICK REVIEW

[论文解读] Generative AI has lowered the barriers to computational social sciences

Yongjun Zhang|arXiv (Cornell University)|Nov 17, 2023
Computational and Text Analysis Methods被引用 4
一句话总结

本文展示了生成式人工智能,特别是 GPT-4 及相关工具,如何通过自动化提示工程、代码生成与调试,降低计算社会科学中复杂多模态数据分析的编程门槛。研究表明,仅需极少的编程知识,研究者即可利用自动化提示工程对 Swin Transformer 模型进行微调,实现对大规模全球图像数据集的抗议图像分类,取得准确预测结果。

ABSTRACT

Generative artificial intelligence (AI) has revolutionized the field of computational social science (CSS), unleashing new possibilities for collecting and analyzing multimodal data, especially for scholars who may not have extensive programming expertise. This breakthrough carries profound implications for social scientists. First, generative AI can significantly enhance the productivity of social scientists by automating the generation, annotation, and debugging of code. Second, it empowers researchers to delve into sophisticated data analysis through the innovative use of prompt engineering. Last, the educational sphere of CSS stands to benefit immensely from these tools, given their exceptional ability to annotate and elucidate complex codes for learners, thereby simplifying the learning process and making the technology more accessible.

研究动机与目标

  • 降低社会科学家参与计算研究时的编程门槛。
  • 使非专家研究人员能够生成、注释和调试用于多模态数据分析的复杂代码。
  • 证明利用生成式人工智能对抗议图像数据集微调视觉模型的可行性。
  • 通过自动化推理管道,简化大规模、全球分布图像数据集的分析流程。
  • 通过 AI 辅助编码与数据处理,提升计算社会科学中的可及性与生产力。

提出的方法

  • 使用 GPT-4 的代码解释器生成用于在抗议图像分类任务上微调 Swin Transformer V2 模型的 Python 脚本。
  • 设计自定义数据集类,从 TSV 注释文件中加载图像及其对应标签。
  • 实现自定义数据合并器,高效批量处理图像张量与标签以用于训练。
  • 使用 Hugging Face 的 Transformers 库加载并基于指定超参数微调预训练的 SwinV2 模型。
  • 通过并行化推理,将训练好的模型应用于存储在按国家分立子文件夹中的 160 万张抗议相关图像进行分类。
  • 使用 PIL 在预测前验证图像文件,并通过异常处理机制优雅地处理错误。

实验结果

研究问题

  • RQ1生成式 AI 工具(如 GPT-4)是否能够使非编程专家仅通过自然语言提示生成用于计算社会科学中视觉模型训练的可用代码?
  • RQ2提示工程在生成用于抗议图像数据集上微调 Swin Transformer 模型的准确且高效代码方面效果如何?
  • RQ3生成式 AI 在多大程度上能够简化从数据加载、模型训练、评估到推理的端到端处理流程,以应对大规模图像分析?
  • RQ4AI 生成的代码是否能够可靠地应对现实世界数据挑战,如多模态数据集中文件验证与错误恢复?
  • RQ5生成式 AI 工具的集成在多大程度上提升了计算社会科学研究的可及性与可扩展性?

主要发现

  • 生成式 AI 仅通过自然语言提示,成功生成了完整的、可运行的 Python 脚本,用于在抗议图像分类任务上微调 Swin Transformer V2 模型。
  • 模型使用标准指标进行训练与评估,评估期间计算了准确率,表明其在测试集上表现稳定可靠。
  • 训练后的模型被成功应用于分类 160 万张图像,这些图像按国家分存于不同文件夹,预测结果已保存至 CSV 文件。
  • 推理管道通过 ThreadPoolExecutor 实现并行执行,显著提升了大规模图像数据集的处理速度。
  • 系统正确处理了文件验证与错误恢复,对无效或无法读取的图像文件进行日志记录,而不会导致崩溃。
  • 从代码生成到推理的整个工作流仅需极少人工干预,凸显了其在推动先进计算方法民主化方面的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。