Skip to main content
QUICK REVIEW

[論文レビュー] Speaker identification from the sound of the human breath

Wenbo Zhao, Yang Gao|arXiv (Cornell University)|Dec 1, 2017
Speech Recognition and Synthesis参考文献 15被引用数 10
ひとこと要約

本稿では、会話中の吸入に伴って生じる息遣い音が、話者の固有のバイオメトリック情報を含み、定常Qスペクトログ램とディープラーニングを用いることで正確な話者識別が可能であることを示している。CNN-LSTMフレームワークを用いた手法は、44人の話者からなるデータセットで91.3%の正確性を達成し、偽装に対する耐性と自然なばらつきの両方を備えることから、法医学的およびバイオメトリクス的応用において有効であることが実証された。

ABSTRACT

This paper examines the speaker identification potential of breath sounds in continuous speech. Speech is largely produced during exhalation. In order to replenish air in the lungs, speakers must periodically inhale. When inhalation occurs in the midst of continuous speech, it is generally through the mouth. Intra-speech breathing behavior has been the subject of much study, including the patterns, cadence, and variations in energy levels. However, an often ignored characteristic is the {\em sound} produced during the inhalation phase of this cycle. Intra-speech inhalation is rapid and energetic, performed with open mouth and glottis, effectively exposing the entire vocal tract to enable maximum intake of air. This results in vocal tract resonances evoked by turbulence that are characteristic of the speaker's speech-producing apparatus. Consequently, the sounds of inhalation are expected to carry information about the speaker's identity. Moreover, unlike other spoken sounds which are subject to active control, inhalation sounds are generally more natural and less affected by voluntary influences. The goal of this paper is to demonstrate that breath sounds are indeed bio-signatures that can be used to identify speakers. We show that these sounds by themselves can yield remarkably accurate speaker recognition with appropriate feature representations and classification frameworks.

研究の動機と目的

  • 会話内での息遣い音が、信頼性の高い識別に十分な話者固有の情報を含むかどうかを調査すること。
  • 発話とは独立したバイオメトリクス的サインチャとしての息遣い音の実用可能性を評価すること。
  • 従来のi-vector手法とディープラーニング(CNN-LSTM)を用いた息遣い音ベースの話者識別との比較を行うこと。
  • 特に法医学的文脈において、偽装や模倣に対してどれほど耐性があるかを評価すること。
  • 話者の意思とは関係なく発生する息遣い音は、安定的かつ不変なバイオメトリクス特徴を提供するという点を実証すること。

提案手法

  • 会話記録の連続音声から、発話セグメント間の急速で口を開けた吸入に着目し、息遣い音を抽出した。
  • 1オクターブあたり48フィルタを用いて、聴覚的に関連する周波数分解能を保持する定常Qスペクトログラムに変換した。
  • 話者内でのピッチ変動を補正するために、エラスティック変換(σ=2, α=15)を用いたデータ拡張を実施した。
  • 入力サイズ463×TのCNN-LSTMニューラルネットワークを訓練し、最初の隠れ層にReLU、2番目の隠れ層にSigmoid、出力層にソフトマックスを用いた。
  • 過学習を防ぐために、バッチサイズ1でAdadelta最適化手法を用い、検証損失に基づく早期停止を実装した。
  • 各話者に対して70%を訓練、20%を検証、10%をテストに割り当て、ハイパーパramータチューニングには交差検証を用いた。

実験結果

リサーチクエスチョン

  • RQ1会話内での息遣い音は、識別用途において信頼性高く話者固有の情報を保持できるか?
  • RQ2i-vectorとディープラーニング(CNN-LSTM)の両手法を用いた息遣い音ベースの話者識別性能は、どのように比較できるか?
  • RQ3息遣い音はどれほど偽装や模倣に対して耐性があり、法医学的応用に適しているか?
  • RQ4ピッチや振幅の変動が生じる中でも、定常Qスペクトログラムが息遣い音特徴を効果的に表現できるか?
  • RQ5CNN-LSTMアーキテクチャが、時間的特徴とシフト不変特徴を自動で学習できることで、話者識別正確性が向上するか?

主な発見

  • CNN-LSTMフレームワークは、話者44名のデータセットを用いて、話者識別正確性が91.3%に達した。これは、最小限の事前仮定のもとで高い性能を示している。
  • i-vectorベースの手法は、LDA + SVMを用いて最大74.1%の正確性を達成した。これは、息遣い音に測定可能な話者固有の特徴が含まれていることを確認した。
  • CNN-LSTMおよびi-vector手法のROC曲線は両者とも高いAUC値を示し、話者認証分野への実用的導入の可能性が示された。
  • 話者ごとに明確なフォルマントパターン(F1, F2, F3)が観察され、模倣の事例でも視覚的スペクトログラムから話者固有の共鳴パターンが明確に識別された。
  • 提案手法は分布仮定フリーであり、短い録音に対しても有効であった。これは、ネットワークが時間的および不変特徴を自動で学習できるからである。
  • 声の模倣者がドナルド・トランプの発話に近く模倣しても、その息遣い音は依然として固有の識別性を保っていた。これは、息遣い音がバイオメトリクスとして極めて頑健であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。