Skip to main content
QUICK REVIEW

[论文解读] Low-rank Adaptation Method for Wav2vec2-based Fake Audio Detection

Chenglong Wang, Jiangyan Yi|arXiv (Cornell University)|Jun 9, 2023
Speech and Audio Processing被引用 5
一句话总结

本文提出低秩微调(LoRA)以高效微调wav2vec2模型用于虚假音频检测,冻结预训练权重并注入低秩矩阵,将可训练参数减少99.49%,同时保持接近全局微调的性能(8秒音频的EER为1.18%)。LoRA显著提升了训练效率,降低显存占用并加快收敛速度,优于全局微调和适配器方法。

ABSTRACT

Self-supervised speech models are a rapidly developing research topic in fake audio detection. Many pre-trained models can serve as feature extractors, learning richer and higher-level speech features. However,when fine-tuning pre-trained models, there is often a challenge of excessively long training times and high memory consumption, and complete fine-tuning is also very expensive. To alleviate this problem, we apply low-rank adaptation(LoRA) to the wav2vec2 model, freezing the pre-trained model weights and injecting a trainable rank-decomposition matrix into each layer of the transformer architecture, greatly reducing the number of trainable parameters for downstream tasks. Compared with fine-tuning with Adam on the wav2vec2 model containing 317M training parameters, LoRA achieved similar performance by reducing the number of trainable parameters by 198 times.

研究动机与目标

  • 为解决在虚假音频检测任务中微调大型预训练wav2vec2模型带来的高计算与显存开销问题。
  • 探索在自监督语音模型中应用参数高效微调方法(如LoRA)在语音欺骗检测场景下的可行性。
  • 在不牺牲检测性能的前提下,降低训练时间与硬件资源需求。
  • 在ASVspoof2019基准上评估LoRA相较于全局微调和基于适配器方法的有效性。

提出的方法

  • 冻结所有预训练wav2vec2模型权重,并在Transformer层的查询(Wq)和值(Wv)投影矩阵中注入可训练的低秩矩阵(B ∈ ℝ^{d×r},A ∈ ℝ^{r×k})。
  • 将模型输出更新为 h = h + BAx,其中 ΔW = BA 是权重更新的低秩近似,且满足 r ≪ d。
  • 仅训练低秩矩阵A和B,同时保持原始权重W固定,从而大幅减少可训练参数数量。
  • 将LoRA应用于多头注意力机制中的查询矩阵(Wq)和值矩阵(Wv),因消融实验表明其性能更优。
  • 采用秩r = 2作为最优设置,在性能与参数效率之间取得平衡。
  • 在ASVspoof2019数据集上评估该方法,测试不同输入长度(1秒至8秒)和批量大小下的鲁棒性与效率。

实验结果

研究问题

  • RQ1LoRA能否在保持性能的前提下,有效减少wav2vec2在虚假音频检测任务中的可训练参数数量?
  • RQ2在检测准确率与训练效率方面,LoRA相较于全局微调和基于适配器的方法表现如何?
  • RQ3在使用wav2vec2进行虚假音频检测时,LoRA的最优秩r应为多少?
  • RQ4输入音频长度如何影响LoRA微调模型的性能与显存需求?
  • RQ5将LoRA应用于特定注意力矩阵(如Wq、Wv)是否优于应用于所有矩阵?

主要发现

  • 与全局微调相比,LoRA将可训练参数数量减少了99.49%,在8秒音频输入下实现1.18%的EER。
  • LoRA的性能仅比全局微调下降0.17%,表明其在可训练参数数量大幅减少的情况下仍能实现近乎等效的准确率。
  • LoRA的训练时间显著快于全局微调——以批量大小16、1秒音频输入为例,训练时间分别为46秒与97秒。
  • LoRA可在不发生显存溢出的情况下支持更大的批量大小(4秒音频时最高达8),而全局微调在批量大小为4时即失败。
  • 将LoRA应用于查询矩阵(Wq)和值矩阵(Wv)的性能优于应用于所有矩阵或仅关键矩阵(Wk)的情况。
  • 输入长度从1秒增至8秒,EER从10.27%提升至1.18%,但显存使用量也随之增加,凸显了性能与效率之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。