[论文解读] Human heuristics for AI-generated language are flawed
本研究表明,人类在专业、服务行业和恋爱关系等情境中,尽管依赖于第一人称代词、缩写形式和家庭关系等有缺陷的启发式判断,仍持续无法识别由AI生成的自我呈现文本,导致AI文本被感知为‘比真人更像真人’。研究发现,这些直觉性线索具有可预测性和可操控性,从而削弱了人类辨别合成语言的能力。
Human communication is increasingly intermixed with language generated by AI. Across chat, email, and social media, AI systems suggest words, complete sentences, or produce entire conversations. AI-generated language is often not identified as such but presented as language written by humans, raising concerns about novel forms of deception and manipulation. Here, we study how humans discern whether verbal self-presentations, one of the most personal and consequential forms of language, were generated by AI. In six experiments, participants (N = 4,600) were unable to detect self-presentations generated by state-of-the-art AI language models in professional, hospitality, and dating contexts. A computational analysis of language features shows that human judgments of AI-generated language are hindered by intuitive but flawed heuristics such as associating first-person pronouns, use of contractions, or family topics with human-written language. We experimentally demonstrate that these heuristics make human judgment of AI-generated language predictable and manipulable, allowing AI systems to produce text perceived as "more human than human." We discuss solutions, such as AI accents, to reduce the deceptive potential of language generated by AI, limiting the subversion of human intuition.
研究动机与目标
- 调查人类是否能可靠地检测自然语言情境中由AI生成的自我呈现文本。
- 识别人们在判断语言是人类还是AI所写时所使用的直觉性启发式方法。
- 研究这些启发式方法如何导致人类在判断AI生成文本时出现系统性错误。
- 评估AI系统是否能利用这些启发式方法,生成比真实人类写作更像人类的文本。
- 提出解决方案,例如‘AI口音’,以降低AI生成语言带来的欺骗风险。
提出的方法
- 在六个受控实验中,共招募4,600名参与者,覆盖专业、服务行业和恋爱关系等多样化情境下的自我呈现文本。
- 使用最先进的语言模型生成在风格和内容上与人类写作相匹配的AI自述文本。
- 通过计算分析语言特征,识别与‘人类感’感知相关的模式。
- 测量人类的检测准确率,并分析响应模式,以确定对特定启发式方法(如代词、缩写、家庭话题)的依赖程度。
- 使用统计建模检验基于启发式判断的可预测性与可操控性。
- 提出并评估了‘AI口音’的概念——即有意设计的风格标记——以增强透明度并减少欺骗性。
实验结果
研究问题
- RQ1人类能否在真实世界沟通情境中可靠地检测由AI生成的自我呈现文本?
- RQ2人类在判断语言是人类还是AI所写时,使用了哪些直觉性启发式方法?
- RQ3这些启发式方法在多大程度上存在缺陷,并可被AI系统系统性地利用,以生成比真实人类写作更像人类的文本?
- RQ4第一人称代词、缩写形式和家庭关系等语言特征如何影响人类对真实感的判断?
- RQ5‘AI口音’能否通过使合成文本更具可识别性,从而降低AI生成语言的欺骗潜力?
主要发现
- 参与者在所有情境下的检测准确率均显著高于随机水平,平均低于50%,表明其无法可靠识别AI生成的自述文本。
- 人类始终将第一人称代词(如‘我’、‘我’)、缩写形式(如‘don’t’、‘I’m’)以及家庭相关话题与人类写作联系起来,尽管这些特征在AI输出中也极为常见。
- 这些启发式方法具有可预测性和可操控性:AI系统能够生成在‘人类感’评分上高于真实人类写作的文本。
- 本研究证明,通过利用人类的认知偏见,AI生成的文本可被感知为‘比真人更像真人’。
- 计算分析证实,与感知人类感最相关的显著语言特征,也正是AI最易操控的特征。
- 研究结果支持引入透明度机制,如‘AI口音’,以应对AI生成语言带来的欺骗风险。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。