Skip to main content
QUICK REVIEW

[論文レビュー] One-Shot Speaker Identification for a Service Robot using a CNN-based Generic Verifier

Ivette Vélez, Caleb Rascón|arXiv (Cornell University)|Sep 11, 2018
Speech Recognition and Synthesis参考文献 10被引用数 5
ひとこと要約

本稿では、再訓練を必要とせずに音声埋め込みを比較するシアンズCNNベースの汎用検証器を用いた、サービスロボット向けワンショット発話者識別システムを提案する。クリーンなデータでは97%の正確性を達成し、実生活の録音では81.2%の正確性を示す。新規発話者を外部音声データベースに動的に追加することで、リアルタイムで高速かつスケーラブルかつ適応可能な発話者認識が実現可能となる。

ABSTRACT

In service robotics, there is an interest to identify the user by voice alone. However, in application scenarios where a service robot acts as a waiter or a store clerk, new users are expected to enter the environment frequently. Typically, speaker identification models need to be retrained when this occurs, which can take an impractical amount of time. In this paper, a new approach for speaker identification through verification has been developed using a Siamese Convolutional Neural Network architecture (SCNN), where it learns to generically verify if two audio signals are from the same speaker. By having an external database of recorded audio of the users, identification is carried out by verifying the speech input with each of its entries. If new users are encountered, it is only required to add their recorded audio to the external database to be able to be identified, without retraining. The system was evaluated in four different aspects: the performance of the verifier, the performance of the system as a classifier using clean audio, its speed, and its accuracy in real-life settings. Its performance in conjunction with its one-shot-learning capabilities, makes the proposed system a viable alternative for speaker identification for service robots.

研究の動機と目的

  • 新規ユーザーが環境に加わった際にモデルの再訓練を必要とせずに、リアルタイムかつ適応可能な発話者識別を実現すること。
  • 新規発話者を追加する際に再訓練が必要な従来の発話者識別システムの制限を克服すること。
  • 2つの音声サンプルが同一発話者由来かどうかを判断する汎用検証モデルを開発し、データベースの動的拡張を可能とすること。
  • 騒音や変動のある音声が存在する実生活環境でも、高い正確性と低遅延を確保し、人間とロボットのシームレスな相互作用を実現すること。
  • レストランや家庭など、頻繁に新規ユーザーが登場する環境に適したスケーラブルなソリューションを提供すること。

提案手法

  • 2つの音声埋め込み間の類似性関数を学習するため、シアンズ畳み込みニューラルネットワーク(SCNN)アーキテクチャを採用する。
  • 同一発話者対と異なる発話者対のペアを用いて対照損失を用いて検証器を学習し、それらを区別する。
  • 音声入力をスペクトログラムとして表現し、音声活動検出(VAD)を用いてエネルギーが十分なセグメントを抽出してデータベースに保存する。
  • 新規ユーザーをモデルの再訓練なしに追加できる、動的な外部データベースを活用して既知の発話者の参照音声を保存する。
  • 訓練済みの検証器を用いて、入力音声をデータベース内のすべてのエントリと比較し、発話者を特定するか、未知と分類する。
  • クリーンコーパスと実生活の録音の両方を用いて性能を評価し、VGG16およびResNet50アーキテクチャに基づくモデルバリアントを検討する。

実験結果

リサーチクエスチョン

  • RQ1新規ユーザーが追加された際に再訓練を必要とせずに、ワンショット発話者識別を可能にする汎用発話者検証モデルを学習可能か?
  • RQ2騒音や変動のある音声入力が存在する実生活環境では、クリーンなテストデータと比較して、このシステムの性能はどの程度か?
  • RQ31人の発話者あたりの音声エントリ数を増加させることで、システムの識別正確性にどのような影響があるか?
  • RQ4インタラクティブなサービスロボットアプリケーションのリアルタイム要件を満たすために、システムの推論速度はどの程度か?
  • RQ5入力音声に背景ノイズや非理想的な録音条件が含まれる状況でも、システムはどの程度の耐性を示すか?

主な発見

  • 最良の性能を示したSCNNモデル(VGG7 32)を用いたクリーンなテストコーパスでは、平均97%の正確性を達成した。
  • 実生活の録音では、平均81.2%の正確性を示し、実用的導入のための目標閾値80%を超えた。
  • VGG7 32モデルは最も高速で、100件のデータベースエントリに対して1つの入力音声を比較するのに0.17秒の検証時間を要した。
  • 1人の発話者あたりの音声エントリ数を増加させることで、大多数のユーザーにおいて性能が向上したが、一部のユーザーでは向上が見られず、わずかに劣化したケースもあった。これは、最適でないVAD選択による可能性がある。
  • ノイズを含むデータベースで学習したモデルは、発話者数と音声エントリ数のさまざまな組み合わせにおいて、実環境条件下でも高い正確性を維持した。
  • 混同行列において、未知の発話者を18例中18例すべてで正しく特定した。これは、強力なゼロショット検出能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。