Skip to main content
QUICK REVIEW

[論文レビュー] Do You Remember? Overcoming Catastrophic Forgetting for Fake Audio Detection

Xiaohui Zhang, Jiangyan Yi|arXiv (Cornell University)|Aug 7, 2023
Music and Audio Processing被引用数 4
ひとこと要約

本稿では、過去の学習データにアクセスできない状況下で、微調整中にリアル音声とフェイク音声の比率に応じてモデル重みを適応的に調整するとともに、分布シフト下でも知識を保持するための正則化を施す、継続的学習手法であるRegularized Adaptive Weight Modification(RAWM)を提案する。RAWMは、クロスデータセット検出ベンチマークにおいて、既存手法を上回る最先端の性能を達成しており、過去の学習データを必要としない。

ABSTRACT

Current fake audio detection algorithms have achieved promising performances on most datasets. However, their performance may be significantly degraded when dealing with audio of a different dataset. The orthogonal weight modification to overcome catastrophic forgetting does not consider the similarity of genuine audio across different datasets. To overcome this limitation, we propose a continual learning algorithm for fake audio detection to overcome catastrophic forgetting, called Regularized Adaptive Weight Modification (RAWM). When fine-tuning a detection network, our approach adaptively computes the direction of weight modification according to the ratio of genuine utterances and fake utterances. The adaptive modification direction ensures the network can effectively detect fake audio on the new dataset while preserving its knowledge of old model, thus mitigating catastrophic forgetting. In addition, genuine audio collected from quite different acoustic conditions may skew their feature distribution, so we introduce a regularization constraint to force the network to remember the old distribution in this regard. Our method can easily be generalized to related fields, like speech emotion recognition. We also evaluate our approach across multiple datasets and obtain a significant performance improvement on cross-dataset experiments.

研究の動機と目的

  • 過去のデータにアクセスできない状況下で、新しいデータセットに微調整する際の継続的学習における深刻な忘却問題を解消すること。
  • リアル/フェイク音声の比率に応じて重み修正の方向を適応的に変更することで、クロスデータセット一般化性能を向上させること。
  • 音声の収録環境が異なることで生じる本物音声の分布の違いに起因する性能低下を軽減すること。
  • フェイク音声検出を越えて、音声感情認識など他の機械学習タスクにも適用可能な手法を開発すること。
  • 経験再現やデータ拡張に依存せず、最小限のインダクティブバイアスで優れた性能を達成すること。

提案手法

  • RAWMは、新しいデータセットに含まれる本物とフェイク発話の割合に応じて、重み修正の方向を適応的に計算する。
  • 古い入力が張る部分空間に直交するプロジェクタを用いるが、本物音声が優勢な場合には、古い入力部分空間に向かって方向を調整する。
  • フェイク音声がより多く存在する場合には、重み修正方向が古い入力部分空間に対して直交する方向にシフトする。
  • 新しいデータセットと古いデータセットの音声条件が著しく異なる場合でも、古い本物音声の特徴分布を保持するための正則化制約を導入する。
  • 過去のデータを保存・再現する必要がないため、特許情報が保護されたモデルの実世界への適用に適している。
  • CLEAR-10ベンチマークを用いた実験により、画像認識タスクへの一般化が確認され、広範な適用可能性が裏付けられた。
(a)
(a)

実験結果

リサーチクエスチョン

  • RQ1過去の学習データにアクセスできない状況下で、新しいデータセットに微調整する際の継続的学習における深刻な忘却問題をどのように軽減できるか?
  • RQ2新しいデータセットにおけるリアル対フェイク音声の比率が変化する場合、最適な重み更新方向は何か?
  • RQ3新しいデータセットと古いデータセットの収録環境が著しく異なる場合、古い本物音声の分布知識をどのように保持できるか?
  • RQ4提案手法は、フェイク音声検出を越えて、他の機械学習タスクにも一般化可能か?
  • RQ5多様なデータセットにおいて、RAWMは既存の継続的学習ベースラインと比較して、性能と頑健性の面でどのように優れているか?

主な発見

  • CLEAR-10画像分類ベンチマークにおいて、10回の経験(Exp10)で平均92.53%の最高精度を達成し、Replay、EWC、LwF、GDF、CWR、OWMをすべて上回った。
  • ASVspoofおよびADDのフェイク音声検出ベンチマークにおいて、最終経験(Exp10)で95.25%の精度を達成し、OWM(95.05%)および他の手法を上回った。
  • クロスデータセット検出において、微調整、EWC、LwF、GDF、CWR、OWMを著しく上回り、分布シフトに対して高い頑健性を示した。
  • Exp3およびExp8において、Replay手法の上限性能に近づいたことから、強力な知識保持能力を示した。
  • 少数のサンプルでの学習でも高い性能を維持でき、優れたサンプル効率性を示した。
  • 正則化部は、音声条件の変化に起因する古い特徴分布の変化を効果的に抑制し、困難なクロスデータセットシナリオにおける一般化性能を向上させた。
(b)
(b)

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。