[论文解读] AI-Synthesized Voice Detection Using Neural Vocoder Artifacts
本文提出了一种新颖的方法,通过识别音频信号中的神经声码器伪影来检测AI合成的人类语音。采用多任务学习框架,声码器识别与合成语音检测共享特征提取器,该方法在未见过的声码器(如MelGAN和Parallel WaveGAN)上表现出高检测准确率,对已见声码器的EER为2.16%,对未见声码器的EER为35.53%。
Advancements in AI-synthesized human voices have created a growing threat of impersonation and disinformation, making it crucial to develop methods to detect synthetic human voices. This study proposes a new approach to identifying synthetic human voices by detecting artifacts of vocoders in audio signals. Most DeepFake audio synthesis models use a neural vocoder, a neural network that generates waveforms from temporal-frequency representations like mel-spectrograms. By identifying neural vocoder processing in audio, we can determine if a sample is synthesized. To detect synthetic human voices, we introduce a multi-task learning framework for a binary-class RawNet2 model that shares the feature extractor with a vocoder identification module. By treating vocoder identification as a pretext task, we constrain the feature extractor to focus on vocoder artifacts and provide discriminative features for the final binary classifier. Our experiments show that the improved RawNet2 model based on vocoder identification achieves high classification performance on the binary task overall.
研究动机与目标
- 应对AI合成语音在冒名顶替和虚假信息传播中日益增长的威胁。
- 克服现有音频检测方法依赖统计特征或手工设计特征的局限性。
- 利用神经声码器伪影——具体且可解释的信号痕迹——作为合成语音检测的判别性线索。
- 通过将声码器识别作为先验任务的多任务学习框架,提升检测的鲁棒性和泛化能力。
- 提供一个公开可用的数据集LibriSeVoc,以支持对合成音频中声码器伪影检测的研究。
提出的方法
- 提出一种多任务学习框架,其中二分类的RawNet2模型与声码器识别模块共享其前端特征提取器。
- 将声码器识别作为先验任务,以约束特征提取器聚焦于声码器级别的伪影。
- 在新构建的数据集LibriSeVoc上训练模型,该数据集包含来自六种最先进神经声码器的自声码样本。
- 应用数据增强技术,包括重采样和添加背景噪声,以评估对后处理的鲁棒性。
- 使用梅尔频谱图作为输入表示,并利用RawNet2架构实现端到端特征学习。
- 对两个分类任务(二分类和声码器识别)均使用交叉熵损失进行模型优化。
实验结果
研究问题
- RQ1神经声码器伪影能否作为检测AI合成人类语音的可靠且可解释的特征?
- RQ2将声码器识别作为先验任务的多任务学习方法,在提升合成语音检测性能方面有多有效?
- RQ3该方法在训练数据中未出现的未见声码器上的泛化能力如何?
- RQ4该检测模型对常见音频后处理操作(如重采样和背景噪声)的鲁棒性如何?
- RQ5该方法在域内和跨数据集评估中能否超越现有最先进模型?
主要发现
- 所提方法在原始LibriSeVoc测试集上实现了0.13%的等错误率(EER),表明检测准确率极高。
- 在WaveFake数据集上,整体EER为26.95%,其中已见声码器(MelGAN、Parallel WaveGAN)的EER为2.16%,表明对熟悉模型具有强大性能。
- 该方法对后处理表现出更强的鲁棒性,在包含重采样和噪声的退化测试集上,EER仅上升至2.73%,而干净数据上的EER为0.13%。
- 模型在未见声码器上的表现较差,WaveFake中未见声码器的EER上升至35.53%,凸显了泛化能力的局限性。
- 多任务学习策略有效约束了特征提取器,使其学习到具有判别性的声码器伪影,从而在检测性能上优于基线RawNet2模型。
- LibriSeVoc数据集成功捕捉了多样化的声码器伪影,支持对声码器特异性信号痕迹的受控研究与训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。