[论文解读] Human Detection of Political Speech Deepfakes across Transcripts, Audio, and Video
本研究通过五项预先注册的实验,利用2,215名美国参与者,调查了人类在文本、音频和视频多种模态下识别AI生成的政治演讲深度伪造的能力。研究发现,音视频线索显著提升了辨别准确率,且使用前沿文本转语音技术生成的音频深度伪造比使用配音演员音频的更难被识别,这挑战了‘视频模态天然更具可信度’的假设。
Recent advances in technology for hyper-realistic visual and audio effects provoke the concern that deepfake videos of political speeches will soon be indistinguishable from authentic video recordings. The conventional wisdom in communication theory predicts people will fall for fake news more often when the same version of a story is presented as a video versus text. We conduct 5 pre-registered randomized experiments with 2,215 participants to evaluate how accurately humans distinguish real political speeches from fabrications across base rates of misinformation, audio sources, question framings, and media modalities. We find base rates of misinformation minimally influence discernment and deepfakes with audio produced by the state-of-the-art text-to-speech algorithms are harder to discern than the same deepfakes with voice actor audio. Moreover across all experiments, we find audio and visual information enables more accurate discernment than text alone: human discernment relies more on how something is said, the audio-visual cues, than what is said, the speech content.
研究动机与目标
- 考察人们在不同媒体模态(文本、音频、视频)下检测政治演讲深度伪造的能力。
- 评估错误信息基率对人类辨别准确率的影响。
- 评估与仅文本相比,音视频模态是否提高了伪造内容的可信度。
- 调查前沿文本转语音算法是否会产生比人类配音演员更具有欺骗性的深度伪造。
- 理解话语内容(说了什么)与表达线索(如何说)在深度伪造检测中的相对作用。
提出的方法
- 进行了五项预先注册的随机实验,参与者为2,215名来自美国的人员。
- 参与者在七种模态条件下之一观看了政治演讲:文本、音频、视频,或结合真实或合成音频的组合。
- 深度伪造使用PDD数据集生成,合成音频来自配音演员和前沿文本转语音模型。
- 实验操纵了深度伪造的基率(10%、50%、90%),并通过不同问题表述方式评估检测准确率。
- 通过注意力检查和排除标准确保数据质量,每项实验因不合规而排除了14至21名参与者。
- 使用混合效应逻辑回归模型对不同模态、音频类型和实验条件下的检测准确率进行统计分析。
实验结果
研究问题
- RQ1媒体模态(文本、音频、视频)是否显著影响人类检测政治演讲深度伪造的能力?
- RQ2错误信息的基率如何影响不同模态下的检测准确率?
- RQ3使用前沿文本转语音模型生成的合成音频的深度伪造,是否比使用人类配音演员音频的更难检测?
- RQ4与话语内容(说了什么)相比,音视频线索(如何说)在检测准确率中的贡献程度如何?
- RQ5深度伪造中是否存在感知失真或讽刺线索,会调节检测表现?
主要发现
- 当音视频线索存在时,参与者检测深度伪造的准确率显著提高,表明‘如何说’比‘说了什么’更具信息量。
- 错误信息的基率对检测准确率影响甚微,表明人们在判断真实性时并不严重依赖统计先验。
- 使用前沿文本转语音模型生成的音频的深度伪造,即使视觉处理完全相同,也显著比使用人类配音演员音频的更难检测。
- 与仅文本条件相比,参与者在视频条件下的检测准确率更高,支持了在深度伪造语境下‘现实感启发’的存在。
- 不自然的嘴部动作和音频不一致是参与者识别深度伪造的主要线索,表明细微的感知失真对检测至关重要。
- 仅1%的参与者表示曾制作过深度伪造,而87%的人表示曾见过相关示例,表明广泛接触但个人参与度较低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。