Skip to main content
QUICK REVIEW

[论文解读] Judgments of research co-created by generative AI: experimental evidence

Paweł Niszczota, Paul Conway|arXiv (Cornell University)|May 3, 2023
Artificial Intelligence in Healthcare and EducationMedicine被引用 3
一句话总结

本实验研究调查了公众对与生成式人工智能共同创作的研究的看法,发现与将任务委托给人类博士生的研究人员相比,那些将任务委托给大型语言模型(LLM)的研究人员在道德可接受性、可信度以及工作质量预期方面均受到更低的评价。关键结果表明,公众对AI辅助研究存在显著负面偏见,道德可接受性、信任度和感知质量方面的效应量范围在 d = -0.78 至 d = -0.85 之间。

ABSTRACT

The introduction of ChatGPT has fuelled a public debate on the use of generative AI (large language models; LLMs), including its use by researchers. In the current work, we test whether delegating parts of the research process to LLMs leads people to distrust and devalue researchers and scientific output. Participants (N=402) considered a researcher who delegates elements of the research process to a PhD student or LLM, and rated (1) moral acceptability, (2) trust in the scientist to oversee future projects, and (3) the accuracy and quality of the output. People judged delegating to an LLM as less acceptable than delegating to a human (d = -0.78). Delegation to an LLM also decreased trust to oversee future research projects (d = -0.80), and people thought the results would be less accurate and of lower quality (d = -0.85). We discuss how this devaluation might transfer into the underreporting of generative AI use.

研究动机与目标

  • 检验将研究任务委托给生成式AI是否会导致对研究人员及其工作的负面评价。
  • 比较公众对AI辅助研究与人类辅助研究在道德可接受性、可信度和感知质量方面的看法。
  • 调查此类偏见是否可能导致学术研究中AI使用情况的报告不足。
  • 理解将大型语言模型(LLM)整合到学术工作流程中的心理与社会影响。

提出的方法

  • 开展了一项包含402名参与者的实验研究,评估参与者对将研究过程部分任务委托给博士生或大型语言模型(LLM)的研究人员的判断。
  • 采用受控的情境化设计,参与者对研究的道德可接受性、可信度以及研究结果的准确性/质量进行评分。
  • 使用标准化评分量表评估道德可接受性、对监督的可信度,以及对结果准确性和质量的感知。
  • 计算Cohen's d效应量以量化AI与人类委托条件之间判断差异的程度。
  • 采用组内与组间比较分析数据,以评估感知差异。

实验结果

研究问题

  • RQ1人们对将研究任务委托给生成式AI的研究人员的道德可接受性如何评价,与委托给人类博士生的研究人员相比如何?
  • RQ2将任务委托给LLM在多大程度上降低了人们对研究人员未来监督项目能力的信任?
  • RQ3当研究由LLM与研究人员共同创作时,人们对准确性和质量的感知与由人类研究人员完成的研究相比有何不同?
  • RQ4这些偏见可能对学术研究中AI的报告与采用产生何种潜在后果?

主要发现

  • 参与者认为将研究任务委托给LLM的道德可接受性显著低于委托给人类博士生,效应量较大(d = -0.78)。
  • 当研究人员使用LLM时,其未来监督项目能力的信任度显著降低,效应量较大(d = -0.80)。
  • 参与者认为由LLM与研究人员共同创作的研究成果在准确性和质量方面较低,效应量较大(d = -0.85)。
  • 结果表明社会对AI辅助研究存在强烈偏见,可能导致学术工作中AI使用情况的报告不足。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。