Skip to main content
QUICK REVIEW

[论文解读] WavMark: Watermarking for Audio Generation

Guangyu Chen, Yu Wu|arXiv (Cornell University)|Aug 24, 2023
Advanced Steganography and Watermarking Techniques被引用 6
一句话总结

WavMark 提出了一种基于可逆神经网络的音频水印框架,可在1秒音频片段中嵌入32比特的不可察觉水印,具备高鲁棒性。其在十种攻击下的平均误码率(BER)为0.48%,较最先进方法提升2800%;同时支持自动水印定位,并适用于多种音频领域。

ABSTRACT

Recent breakthroughs in zero-shot voice synthesis have enabled imitating a speaker's voice using just a few seconds of recording while maintaining a high level of realism. Alongside its potential benefits, this powerful technology introduces notable risks, including voice fraud and speaker impersonation. Unlike the conventional approach of solely relying on passive methods for detecting synthetic data, watermarking presents a proactive and robust defence mechanism against these looming risks. This paper introduces an innovative audio watermarking framework that encodes up to 32 bits of watermark within a mere 1-second audio snippet. The watermark is imperceptible to human senses and exhibits strong resilience against various attacks. It can serve as an effective identifier for synthesized voices and holds potential for broader applications in audio copyright protection. Moreover, this framework boasts high flexibility, allowing for the combination of multiple watermark segments to achieve heightened robustness and expanded capacity. Utilizing 10 to 20-second audio as the host, our approach demonstrates an average Bit Error Rate (BER) of 0.48\% across ten common attacks, a remarkable reduction of over 2800\% in BER compared to the state-of-the-art watermarking tool. See https://aka.ms/wavmark for demos of our work.

研究动机与目标

  • 应对语音克隆和合成语音滥用带来的日益增长的风险,包括语音欺诈和冒名顶替行为。
  • 克服先前基于深度神经网络(DNN)的水印方法在自动水印定位方面能力不足、容量低且不可察觉性差的局限性。
  • 开发一种可实现可靠、真实世界部署的音频水印系统,用于合成语音检测与版权保护。
  • 在保持高音频质量与低感知度的同时,提升对常见音频攻击的鲁棒性。
  • 通过大规模、多领域训练,使框架在不同音频类型(包括语音、音乐和环境音)之间具备良好的泛化能力。

提出的方法

  • 利用可逆神经网络(INNs)通过共享参数统一编码与解码过程,提升鲁棒性并支持高容量水印嵌入。
  • 引入一种位移模块,通过新型BFD(反向-正向检测)方法实现鲁棒的水印定位,无需依赖外部同步码。
  • 采用32比特消息编码方案,将水印嵌入1秒音频片段中,并通过重叠或相邻片段的迭代水印化实现全时长保护。
  • 在涵盖语音、音乐和环境声音的5000小时多样化数据集上进行训练,以提升对未知音频生成模型输出的泛化能力。
  • 使用信噪比(SNR)和PESQ作为感知质量度量指标,并通过阈值过滤(SNR < 25 dB)避免在静音段中引入噪声水印。
  • 采用基于模式的定位策略,利用32比特载荷中的10比特识别水印片段,实现在未知位置下仍可检测水印。

实验结果

研究问题

  • RQ1可逆神经网络能否有效应用于音频水印,以在保持不可察觉性的同时提升鲁棒性与容量?
  • RQ2如何在不依赖外部同步码的情况下实现水印定位?该方法对系统可靠性与性能有何影响?
  • RQ3在多样化、多领域音频上进行训练,能在多大程度上提升合成语音水印的泛化能力与鲁棒性?
  • RQ4在各种音频攻击下,水印容量、不可察觉性与鲁棒性之间存在何种权衡?
  • RQ5当水印嵌入静音或静默音频段时,模型表现如何?可采取哪些缓解策略?

主要发现

  • WavMark在十种常见音频攻击下的平均误码率(BER)为0.48%,较最先进工具Audiowmark低2800%,展现出卓越的鲁棒性。
  • 与先前基于DNN的方法相比,其感知质量提升6 dB(SNR > 36 dB),实现了高度不可察觉性。
  • 通过BFD方法实现的自动水印定位,将因定位错误导致的解码错误降低至仅0.54% BER,较传统同步码方法提升19倍。
  • 即使水印被剪切或偏移,模型仍保持高性能,BER仅在超过有效可用长度(EUL)10%后开始缓慢上升;在EUL偏移达35%时性能才显著下降。
  • 在静音段中嵌入水印会导致可听噪声,因训练数据中缺乏此类样本;但可通过后处理过滤掉SNR < 25 dB的段落加以缓解。
  • 32 bps模型参数量为250万,其中43%用于消息编码/解码层;在GPU上推理速度为实时的54.2倍,在CPU上为7.7倍,BFD检测在CPU上为0.38倍实时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。