Skip to main content
QUICK REVIEW

[論文レビュー] Speaking Style Authentication Using Suprasegmental Hidden Markov Models

Ismail Shahin|arXiv (Cornell University)|Jun 29, 2017
Speech and Audio Processing参考文献 21被引用数 9
ひとこと要約

本稿では、ピッチ、エネルギー、リズムなどの音声的特徴に基づいて、話者およびテキストに依存する話し方の認証システムを提案する。この手法は、中立的スタイルでは平均99%、ゆっくりとした発話では最大85%の認証精度を達成し、怒り、恐れ、叫び声などの多様な話し方においても高い性能を示している。

ABSTRACT

The importance of speaking style authentication from human speech is gaining an increasing attention and concern from the engineering community. The importance comes from the demand to enhance both the naturalness and efficiency of spoken language human-machine interface. Our work in this research focuses on proposing, implementing, and testing speaker-dependent and text-dependent speaking style authentication (verification) systems that accept or reject the identity claim of a speaking style based on suprasegmental hidden Markov models (SPHMMs). Based on using SPHMMs, our results show that the average speaking style authentication performance is: 99%, 37%, 85%, 60%, 61%, 59%, 41%, 61%, and 57% belonging respectively to the speaking styles: neutral, shouted, slow, loud, soft, fast, angry, happy, and fearful.

研究の動機と目的

  • 人間と機械の相互作用を向上させるため、ロバストな話者およびテキストに依存する話し方認証システムを開発すること。
  • 話者本人の識別や発話内容そのもの以外の、話し方のスタイルに基づく本人確認の課題を解決すること。
  • 話者のスタイルを区別するための超音声特徴の有効性を評価すること。
  • プロソディック特徴に基づいて訓練されたHMMを用いた話し方の認証のためのベースラインを確立すること。
  • 感情的・表現的発話の変動が認証精度に与える影響を分析すること。

提案手法

  • システムは、ピッチ、エネルギー、ゼロクロスレートなどの超音声特徴を音声信号から抽出することで、話し方のスタイルをモデル化する。
  • 超音声隠れマルコフモデル(SPHMM)は、話し方の時間的ダイナミクスを表現するために、プロソディック特徴に基づいて訓練される。
  • 話者に依存し、テキストに依存する訓練が採用され、各話者の声が、異なるスタイルにおける特定の発話に対してモデル化される。
  • 特徴ベクトルは音声フレームから導出され、HMMの状態空間内で異なる話し方スタイルを表すクラスタにグループ化される。
  • 認証は、テスト発話が各話者・スタイルモデル下での尤度を計算し、最もスコアの高い一致を選択することで実行される。
  • システムの性能は、9つの異なる話し方スタイルにおいて等誤差率(EER)と精度を用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1超音声特徴は、話者認証のための異なる話し方を効果的に区別できるか?
  • RQ2SPHMMの性能は、中立的、怒り、叫び声などの多様な話し方においてどのように変動するか?
  • RQ3テキスト依存性および話者依存性が認証精度に与える影響は何か?
  • RQ4感情的・表現的発話の変動が、システム性能をどの程度低下または向上させるか?
  • RQ5提案されたSPHMMベースの手法は、従来の話者認証システムと比較して、スタイル固有の精度においてどのように異なるか?

主な発見

  • 中立的話し方では99%の認証精度を達成し、テストされたすべてのスタイルの中で最高の性能を示した。
  • 叫び声では37%に低下し、極端な音声強度をモデル化する課題が示された。
  • ゆっくりとした発話では85%の精度を達成し、制御された、意図的な発話において優れた性能を示した。
  • 大きな声、小さな声、速い発話、怒り、喜び、恐れのスタイルでは、それぞれ60%、61%、59%、41%、61%、57%の精度を示し、中程度から高い信頼性があることが示された。
  • 結果から、SPHMMは、制御された状態や、極端でないが表現的な状態では、話者のプロソディックな変化を効果的にモデル化できることを示した。
  • 研究は、超音声特徴が、スタイルベースの認証において顕著に識別能が高く、発話の感情的・身体的強度に応じて性能に顕著な差が生じることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。