Skip to main content
QUICK REVIEW

[論文レビュー] FairSSD: Understanding Bias in Synthetic Speech Detectors

Amit Kumar Singh Yadav, Kratika Bhagtani|arXiv (Cornell University)|Apr 17, 2024
Speech Recognition and Synthesis被引用数 4
ひとこと要約

本稿では、性別、年齢、アクセント、発話障害のデモグラフィック要因について、6つの最先端の合成音声検出器におけるバイアスの包括的評価であるFairSSDを紹介する。0.9百万件を超える本物の音声サンプルを用いた研究では、顕著な公平性の問題が明らかになった。検出器は男性、60代の高齢者、南アジア系およびオーストラリア英語話者、およびチック(チック症)を持つ人々に対して高い偽陽性率を示しており、障害あり発話では平均EERが5.29%から36.31%に上昇するなど、現在の検出システムにおける深刻な公平性のギャップが浮き彫りになった。

ABSTRACT

Methods that can generate synthetic speech which is perceptually indistinguishable from speech recorded by a human speaker, are easily available. Several incidents report misuse of synthetic speech generated from these methods to commit fraud. To counter such misuse, many methods have been proposed to detect synthetic speech. Some of these detectors are more interpretable, can generalize to detect synthetic speech in the wild and are robust to noise. However, limited work has been done on understanding bias in these detectors. In this work, we examine bias in existing synthetic speech detectors to determine if they will unfairly target a particular gender, age and accent group. We also inspect whether these detectors will have a higher misclassification rate for bona fide speech from speech-impaired speakers w.r.t fluent speakers. Extensive experiments on 6 existing synthetic speech detectors using more than 0.9 million speech signals demonstrate that most detectors are gender, age and accent biased, and future work is needed to ensure fairness. To support future research, we release our evaluation dataset, models used in our study and source code at https://gitlab.com/viper-purdue/fairssd.

研究の動機と目的

  • 合成音声検出器が特定の性別、年齢、アクセントに対してデモグラフィックバイアスを示すかどうかを調査すること。
  • 特にチック症を有する人々の本物の発話を、合成音声として誤分類する検出器の傾向を評価すること。
  • 大規模かつ多様な音声コーパスを用いて、既存の検出器における公平性のギャップを定量化すること。
  • 今後の研究を支援するため、包括的な評価データセット、モデル、およびコードをリリースすること。

提案手法

  • 本研究では、Mozilla Common VoiceおよびSep-28K(発話障害者向け)のデータセットから収集した0.9百万件の本物の音声サンプルを用いて、6つの既存の合成音声検出器を評価した。
  • デモグラフィックグループは性別(男性/女性)、年齢(10代、20代、30代、40代、50代、60代)、およびアクセント(例:南アジア系、オーストラリア英語、アメリカ英語、イギリス英語)で定義された。
  • バイアスの測定には、各デモグラフィックサブグループの偽陽性率(FPR)と等誤差率(EER)を計算し、独立評価セットから導出されたしきい値を用いた。
  • 統計的分析により、デモグラフィックグループ間でのFPRおよびEERの差を比較し、検出器性能における顕著な格差を同定した。
  • 評価には、実世界の検出シナリオと、標準化された指標を用いた制御された比較が含まれる。
  • すべてのモデル、データセット、およびコードはGitLabを通じて公開され、再現性および今後の公平性研究を促進する。

実験結果

リサーチクエスチョン

  • RQ1合成音声検出器は、特定の性別グループに対してより高い偽陽性率を示すか?
  • RQ2若年層と比較して、60代の高齢者からの発話を、合成音声として誤分類する確率は高いか?
  • RQ3南アジア系やオーストラリア英語など、地域的アクセントの違いによって、性能に顕著な格差が生じるか?
  • RQ4チック症などの発話障害を有する人々の本物の発話を、合成音声として誤分類する偽陽性率が上昇するか?
  • RQ5検出器におけるデモグラフィックバイアスは、実世界での展開における信頼性と公平性をどの程度損なうか?

主な発見

  • 合成音声検出器は顕著な性別バイアスを示しており、男性発話者では女性と比較して平均FPRが1.27%上昇した。
  • 60代の発話者群は20代群と比較して平均FPRが1.27%上昇し、年齢に基づくバイアスが確認された。
  • 南アジア系およびオーストラリア英語アクセントグループが最も高いFPR上昇を示し、アメリカ英語と比較して平均FPR差はそれぞれ1.03%および1.27%であった。
  • チック発話ではEERが著しく上昇し、流暢な発話では5.29%であったのに対し、障害あり発話では36.31%に上昇した。これは、発話障害者に対する深刻なバイアスを示している。
  • 固定しきい値を用いた場合、チック発話におけるすべての検出器の平均FPRは70%を超えており、本物の発話を合成音声として誤分類する広範な問題が確認された。
  • D05はチック発話でEERが11.00%上昇し、最も高い上昇率を示した。一方、D04はすべてのデモグラフィックグループにわたり、最も一貫したバイアスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。