[论文解读] A Cross-Verification Approach for Protecting World Leaders from Fake and Tampered Audio
本文提出了一种交叉验证框架,通过使用改进的Needleman-Wunsch算法将可疑音频与可信参考音频对齐,并利用深度学习模型对帧级匹配进行分类,从而验证世界领导人演讲录音的真实性。该方法在50毫秒容差下实现了99.7%的对齐准确率,帧归属的等错误率为0.43%,显著优于动态时间规整(DTW)及现有方法,在检测篡改音频方面表现优异。
This paper tackles the problem of verifying the authenticity of speech recordings from world leaders. Whereas previous work on detecting deep fake or tampered audio focus on scrutinizing an audio recording in isolation, we instead reframe the problem and focus on cross-verifying a questionable recording against trusted references. We present a method for cross-verifying a speech recording against a reference that consists of two steps: aligning the two recordings and then classifying each query frame as matching or non-matching. We propose a subsequence alignment method based on the Needleman-Wunsch algorithm and show that it significantly outperforms dynamic time warping in handling common tampering operations. We also explore several binary classification models based on LSTM and Transformer architectures to verify content at the frame level. Through extensive experiments on tampered speech recordings of Donald Trump, we show that our system can reliably detect audio tampering operations of different types and durations. Our best model achieves 99.7% accuracy for the alignment task at an error tolerance of 50 ms and a 0.43% equal error rate in classifying audio frames as matching or non-matching.
研究动机与目标
- 应对日益增长的针对世界领导人的深度伪造和篡改音频威胁。
- 开发一种利用可信参考录音而非孤立分析音频的稳健语音真实性验证方法。
- 实现对真实录音的正面验证,而不仅仅是假货检测。
- 在检测各种篡改操作(包括插入、删除和替换)方面实现高准确率。
- 通过依赖多源交叉验证,使系统对不断演进的音频欺骗技术具备鲁棒性。
提出的方法
- 采用两阶段交叉验证系统:首先使用改进的Needleman-Wunsch算法(SNWTW)将查询音频与可信参考音频对齐。
- SNWTW引入与帧不匹配成本无关的跳过惩罚机制,相较于动态时间规整(DTW),能更好地处理插入和删除操作。
- 对齐过程使用包含匹配、不匹配和跳过权重的评分矩阵,优化在时间扭曲下的子序列对齐。
- 帧级归属模型利用双向LSTM和Transformer架构,对每个音频帧分类为匹配或非匹配。
- 系统在包含不同持续时间(0.1秒至5秒)插入、删除和替换的合成篡改场景下进行训练。
- 该框架在唐纳德·特朗普演讲的篡改录音上进行评估,使用多个来源的音频及不同码率(96kbps至160kbps)。
实验结果
研究问题
- RQ1基于可信参考录音的交叉验证系统是否能可靠检测出世界领导人音频的篡改内容,即使篡改内容与真实内容难以区分?
- RQ2改进的Needleman-Wunsch算法(SNWTW)与动态时间规整(DTW)相比,在将篡改音频序列与参考录音对齐方面表现如何?
- RQ3深度学习模型(LSTM、BiLSTM、Transformer)在对查询音频与参考音频之间的帧级匹配进行分类时表现如何?
- RQ4编辑持续时间与训练持续时间(L=2s)的偏差以及音频码率如何影响系统的对齐与分类准确率?
- RQ5该系统是否能在多种篡改操作和真实世界音频质量变化下保持高准确率?
主要发现
- SNWTW对齐方法在50毫秒误差容限下达到99.7%的准确率,显著优于动态时间规整(DTW),后者稳定在约2.8%的错误率。
- 表现最佳的模型为3层双向LSTM,其在帧级归属任务中实现0.43%的等错误率(EER),优于标准LSTM和Transformer模型。
- 随着编辑持续时间与训练持续时间(L=2s)的偏差增大,性能下降,0.1秒编辑的EER上升至15.14%,但对1秒和2秒编辑仍保持强劲表现。
- 音频码率对性能影响可忽略,即使在96kbps下结果依然稳定,表明系统在不同音质水平下具备鲁棒性。
- 该系统在多种篡改操作(包括插入、删除和替换)中保持高准确率,证明其对现实攻击场景具有良好的泛化能力。
- 交叉验证方法实现了对真实录音的正面验证,提供了一种独立于深度伪造技术复杂度的永久性解决方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。