[论文解读] Contrasting Linguistic Patterns in Human and LLM-Generated News Text
本研究利用LLaMA系列模型对比分析了人类撰写与大型语言模型(LLM)生成的英文新闻文本,在词素句法、心理测量及社会语言学等多个维度上探究其语言模式。尽管生成文本流畅度高,LLM生成的内容仍表现出更客观的语言风格、更短的短语结构、更少的攻击性情绪(如恐惧、厌恶),以及更高的代词使用频率——同时,这些模型还反映并放大了人类常见的性别偏见,尤其在参数量更大的模型中更为显著。
We conduct a quantitative analysis contrasting human-written English news text with comparable large language model (LLM) output from six different LLMs that cover three different families and four sizes in total. Our analysis spans several measurable linguistic dimensions, including morphological, syntactic, psychometric, and sociolinguistic aspects. The results reveal various measurable differences between human and AI-generated texts. Human texts exhibit more scattered sentence length distributions, more variety of vocabulary, a distinct use of dependency and constituent types, shorter constituents, and more optimized dependency distances. Humans tend to exhibit stronger negative emotions (such as fear and disgust) and less joy compared to text generated by LLMs, with the toxicity of these models increasing as their size grows. LLM outputs use more numbers, symbols and auxiliaries (suggesting objective language) than human texts, as well as more pronouns. The sexist bias prevalent in human text is also expressed by LLMs, and even magnified in all of them but one. Differences between LLMs and humans are larger than between LLMs.
研究动机与目标
- 探究类似LLaMA的大型语言模型(LLMs)是否复现了人类撰写新闻文本的语言模式。
- 识别人类与AI生成新闻在词素句法、心理测量及社会语言学特征方面的可测量差异。
- 评估模型规模是否影响其与人类语言规范的偏离程度。
- 评估人类偏见(如性别偏见)在LLM生成内容中是否持续存在。
- 建立一个受控的、新颖的基准,用于通过语言特征分析检测合成文本。
提出的方法
- 从《纽约时报》API收集了11,133篇人类撰写的新闻文章,聚焦于LLaMA模型发布日期之后发布的标题与导语段,以防止数据泄露。
- 使用LLaMA模型基于人类标题和首句生成新闻内容,确保生成内容未从训练数据中记忆。
- 在多个语言维度上进行定量分析:词汇使用、句子长度、词性(PoS)分布、依存与短语结构、情绪基调,以及代词使用、性别偏见等社会语言学特征。
- 采用标准化的自然语言处理工具进行句法解析(依存树与短语结构树)、情绪检测(如恐惧、厌恶)及偏见测量(如代词频率、性别化语言)。
- 通过比较不同规模的LLaMA模型结果,评估模型规模对语言偏离程度的影响。
- 使用来自权威新闻源的受控实时数据,确保数据新鲜性并最大限度降低记忆化风险。

实验结果
研究问题
- RQ1LLM生成的新闻文本在句法结构上是否与人类撰写的新闻存在统计学上的显著差异?
- RQ2LLM在情绪基调使用上与人类有何不同,特别是在恐惧、厌恶等负面情绪方面?
- RQ3LLM在多大程度上复现或放大了人类文本中存在的社会语言学偏见(如性别化代词使用)?
- RQ4模型规模在多大程度上影响了人类与LLM生成新闻之间的语言偏离程度?
- RQ5在词汇多样性、符号/数字使用及助动词使用方面,人类与AI生成的新闻是否存在可测量的差异?
主要发现
- 人类新闻文本的句子长度分布更为分散,而LLM生成文本的分布则更趋均匀。
- 与人类文本相比,LLaMA模型使用了显著更多的数字、符号和助动词,表明其更偏好客观、正式的语言风格。
- LLM生成的文本表现出更短的短语结构跨度,且在依存结构与短语类型分布上与人类撰写的新闻存在明显差异。
- 尽管流畅度高,LLM表达的攻击性负面情绪(如恐惧、厌恶)仍少于人类文本,但这种倾向随模型规模增大而增强。
- LLaMA模型中男性代词的使用频率高于人类文本,反映出并放大了训练数据中既有的性别偏见。
- 本研究证实,即使高度流畅的LLM也会产生在语言学上可区分的输出,从而可通过语言特征分析实现潜在检测。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。