[论文解读] Warning: Humans Cannot Reliably Detect Speech Deepfakes
本研究通过一项包含529名参与者的受控在线实验,评估了人类在英语和中文语境下识别语音深度伪造的能力。尽管已知并接触过示例,听众的检测准确率仅为73%,且语言间无显著差异;熟悉度仅略微提升表现——凸显了亟需依赖自动化检测系统而非人类判断来应对深度伪造语音欺诈。
Speech deepfakes are artificial voices generated by machine learning models. Previous literature has highlighted deepfakes as one of the biggest security threats arising from progress in artificial intelligence due to their potential for misuse. However, studies investigating human detection capabilities are limited. We presented genuine and deepfake audio to n = 529 individuals and asked them to identify the deepfakes. We ran our experiments in English and Mandarin to understand if language affects detection performance and decision-making rationale. We found that detection capability is unreliable. Listeners only correctly spotted the deepfakes 73% of the time, and there was no difference in detectability between the two languages. Increasing listener awareness by providing examples of speech deepfakes only improves results slightly. As speech synthesis algorithms improve and become more realistic, we can expect the detection task to become harder. The difficulty of detecting speech deepfakes confirms their potential for misuse and signals that defenses against this threat are needed.
研究动机与目标
- 评估英语和中文语境下人类对语音深度伪造的检测准确率,以评估语言依赖性检测表现。
- 调查让听众接触深度伪造示例是否能提升其检测能力。
- 检验语境线索或音频配对方式(二元对比 vs. 单一)是否影响检测表现。
- 理解如不自然感等感知线索在人类检测深度伪造中的作用。
- 通过识别人类感知在检测合成语音方面的局限性,为开发稳健防御措施提供依据。
提出的方法
- 在英语和中文母语者群体中开展一项在线实验,共招募529名参与者。
- 音频片段以两种配置呈现:单一样本(每轮仅一个音频)和双样本(每轮一对音频,一真一假)。
- 使用基于较旧、技术较落后的语音合成模型生成实验刺激材料。
- 通过随机分配的熟悉化干预措施(提供深度伪造示例)评估其对检测表现的影响。
- 收集置信度调整后的准确率分数,以分析决策的可靠性。
- 使用统计建模方法,分析在语言、配置和熟悉度条件下的检测表现差异。

实验结果
研究问题
- RQ1人类能否在英语和中文语境下可靠地区分真实语音与语音深度伪造?
- RQ2事先接触深度伪造示例是否能提升人类的检测准确率?
- RQ3在单一样本与双样本音频呈现格式之间,检测表现是否存在显著差异?
- RQ4听众在检测深度伪造时是否依赖语言特定的声学线索?
- RQ5语音的自然感感知如何影响人类的检测决策?
主要发现
- 人类对语音深度伪造的检测准确率仅为73%,表明即使在受控条件下,其检测能力也不可靠。
- 英语和中文听众在检测表现上无显著差异,表明语言不影响可检测性。
- 让参与者接触深度伪造示例仅略微提升了检测准确率,表明意识宣传措施效果有限。
- 无论语言如何,听众主要依赖感知到的不自然感作为判断线索,表明存在共享的感知启发式机制。
- 检测表现未因听音时间延长或采用双样本对比而提升,表明认知负荷和任务设计对检测帮助不大。
- 结果表明,基于人类的检测手段不足以应对现实世界中的防御需求,必须依赖自动化检测系统。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。