Skip to main content
QUICK REVIEW

[论文解读] Long-form analogies generated by chatGPT lack human-like psycholinguistic properties

S. M. Seals, Valerie L. Shalin|arXiv (Cornell University)|Jun 7, 2023
Topic Modeling被引用 5
一句话总结

本研究利用Coh-Metrix中的心理语言学特征,评估了聊天GPT与生物化学课程中学生生成的长篇类比在语言结构、连贯性和认知处理标记上的差异。尽管输出流利,但聊天GPT生成的类比在语言结构、连贯性和认知处理指标上与人类生成的类比存在显著差异,表明其在模拟人类类比推理和语言使用方面存在局限。

ABSTRACT

Psycholinguistic analyses provide a means of evaluating large language model (LLM) output and making systematic comparisons to human-generated text. These methods can be used to characterize the psycholinguistic properties of LLM output and illustrate areas where LLMs fall short in comparison to human-generated text. In this work, we apply psycholinguistic methods to evaluate individual sentences from long-form analogies about biochemical concepts. We compare analogies generated by human subjects enrolled in introductory biochemistry courses to analogies generated by chatGPT. We perform a supervised classification analysis using 78 features extracted from Coh-metrix that analyze text cohesion, language, and readability (Graesser et. al., 2004). Results illustrate high performance for classifying student-generated and chatGPT-generated analogies. To evaluate which features contribute most to model performance, we use a hierarchical clustering approach. Results from this analysis illustrate several linguistic differences between the two sources.

研究动机与目标

  • 评估由聊天GPT生成的长篇类比在科学推理语境中是否表现出类人心理语言学特征。
  • 识别区分大型语言模型生成类比与人类学习者生成类比的特定语言与认知特征。
  • 评估心理语言学指标在检测人类与AI生成文本在复杂推理任务中细微差异方面的有效性。
  • 探讨这些差异对教育评估以及大型语言模型在学术环境中应用的启示。

提出的方法

  • 从生物化学入门课程中的人类学生和聊天GPT处收集了针对相同提示的长篇类比。
  • 从Coh-Metrix中提取了78项心理语言学特征,包括连贯性、句法复杂性、词汇频率、词性、连接词和指代手段。
  • 应用监督分类模型,利用提取的特征区分聊天GPT与人类生成的类比。
  • 通过层次聚类识别对分类性能贡献最大的特征组。
  • 进行推断统计检验(t检验、Levene检验),评估两组间特征分布差异的显著性。
  • 使用具有1099自由度的平衡数据集进行方差检验,重点关注发生率和分布特性。

实验结果

研究问题

  • RQ1聊天GPT生成的长篇类比在心理语言学特征上是否与人类学生生成的类比存在差异?
  • RQ2哪些具体的语言和连贯相关特征最能区分聊天GPT生成的类比与人类生成的类比?
  • RQ3词汇选择、句法结构和连贯性的差异在多大程度上反映了人类与大型语言模型之间潜在的认知处理差异?
  • RQ4人类与AI生成类比在特征使用方差模式(如代词、连接词、动词)上存在何种差异?
  • RQ5心理语言学特征能否检测出人类与大型语言模型生成的推理文本之间非流利性为基础的细微差异?

主要发现

  • 监督分类器利用Coh-Metrix提取的78项心理语言学特征,实现了在区分聊天GPT生成与人类生成类比方面的高性能表现。
  • 与人类生成的类比相比,聊天GPT生成的类比显著减少了显式连接词、代词和连贯手段的使用。
  • 人类参与者在词汇选择上表现出更大的方差,尤其是在有意动词和动词连贯性方面,表明其认知处理更具多样性。
  • 聊天GPT的输出表现出更高的句法简单性以及更频繁使用被动语态,表明其写作风格更具程式化特征。
  • 观察到叙事性和连通性方面的差异,尽管聊天GPT被优化为对话式输出,但其生成内容更缺乏叙事性。
  • 聊天GPT输出在深层连贯性、指代连贯性和时间性相关特征上显著偏低,表明其读者支持机制较弱。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。