Skip to main content
QUICK REVIEW

[论文解读] ChatGPT v Bard v Bing v Claude 2 v Aria v human-expert. How good are AI chatbots at scientific writing?

Edisa Lozić, Benjamin Štular|arXiv (Cornell University)|Sep 14, 2023
Artificial Intelligence in Healthcare and Education参考文献 57被引用 4
一句话总结

本研究在人文学科和考古学语境下,对比评估了六种AI聊天机器人——ChatGPT-4、ChatGPT-3.5、Bing、Bard、Claude 2和Aria——与人类专家在科学写作方面的能力。通过定量评估事实准确性及定性分析科学贡献,研究发现ChatGPT-4在事实准确性方面表现最佳,而所有AI模型均未能生成原创性科学内容,凸显了AI在复制人类学术写作原创性方面仍存在持续性局限。

ABSTRACT

Historical emphasis on writing mastery has shifted with advances in generative AI, especially in scientific writing. This study analysed six AI chatbots for scholarly writing in humanities and archaeology. Using methods that assessed factual correctness and scientific contribution, ChatGPT-4 showed the highest quantitative accuracy, closely followed by ChatGPT-3.5, Bing, and Bard. However, Claude 2 and Aria scored considerably lower. Qualitatively, all AIs exhibited proficiency in merging existing knowledge, but none produced original scientific content. Inter-estingly, our findings suggest ChatGPT-4 might represent a plateau in large language model size. This research emphasizes the unique, intricate nature of human research, suggesting that AI's emulation of human originality in scientific writing is challenging. As of 2023, while AI has transformed content generation, it struggles with original contributions in humanities. This may change as AI chatbots continue to evolve into LLM-powered software.

研究动机与目标

  • 评估主流AI聊天机器人在人文学科和考古学语境下的科学写作质量。
  • 评估AI生成内容在事实正确性及科学贡献方面与人类专家的对比表现。
  • 探究大型语言模型是否能够产生原创性科学洞见,还是仅能综合已有知识。
  • 探讨当模型规模增大时性能是否趋于平台期,尤其是GPT-4模型。
  • 理解当前AI在模拟人类学术研究原创性与深度方面的局限性。

提出的方法

  • 本研究采用对比评估框架,针对人文学科和考古学领域的一组标准化科学写作任务展开评估。
  • 通过将AI输出与真实数据及专家验证的资料进行比对,定量衡量事实正确性。
  • 通过专家评审进行定性评估,重点关注内容的新颖性、连贯性及方法论的严谨性。
  • 评估对象包括五种AI模型——ChatGPT-4、ChatGPT-3.5、Bing、Bard、Claude 2,以及人类专家的回应作为基准对照。
  • 采用图示摘要和要点展示,以提升关键发现的清晰度与可及性。
  • 通过同行评审的开放获取出版形式,验证并传播研究结果。

实验结果

研究问题

  • RQ1在人文学科和考古学领域,不同AI聊天机器人在生成科学内容时的事实准确性表现如何?
  • RQ2AI聊天机器人在多大程度上能够产生原创性科学贡献,而非仅对已有知识进行整合?
  • RQ3大型语言模型的性能是否在GPT-4水平达到平台期,还是新模型展现出显著提升?
  • RQ4AI模型的科学写作质量与人类专家在学术领域中的表现相比如何?
  • RQ5当前AI在复制人类研究在科学写作中的深度与原创性方面,存在哪些持续性局限?

主要发现

  • ChatGPT-4在所有评估的AI模型中,事实正确性的定量准确性表现最高。
  • ChatGPT-3.5、Bing和Bard在事实准确性方面紧随ChatGPT-4之后,表明顶级模型整体表现强劲。
  • Claude 2和Aria在事实正确性方面得分显著偏低,反映出领先大语言模型之间存在性能差异。
  • 所有AI模型均展现出良好能力,可整合并重述已有知识,但均未能生成原创性科学洞见。
  • 本研究推测,ChatGPT-4可能代表了大型语言模型能力的性能平台期,模型规模增大带来的收益递减。
  • 人类专家在生成原创性、概念新颖的科学内容方面仍无可替代,凸显了人类原创性在学术研究中的不可替代作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。