Skip to main content
QUICK REVIEW

[論文レビュー] Automatic recognition of child speech for robotic applications in noisy environments

Samuel Fernando, Roger K. Moore|arXiv (Cornell University)|Nov 8, 2016
Speech and dialogue systems参考文献 11被引用数 8
ひとこと要約

本論文では、Kaldiツールキットを用いた深層ニューラルネットワーク(DNN)とリアルタイム言語モデル適応を活用し、騒音環境下における子供とロボットの対話に適した耐障害性の高い自動音声認識(ASR)システムを提示する。本システムは、320名の子供が参加した実際の博物館での展開において、流暢で語彙内の子供の発話に対して90%の正確性を達成した。これは、データ拡張と動的対話統合により、騒音と話者変動に対する高い耐性を示している。

ABSTRACT

Automatic speech recognition (ASR) allows a natural and intuitive interface for robotic educational applications for children. However there are a number of challenges to overcome to allow such an interface to operate robustly in realistic settings, including the intrinsic difficulties of recognising child speech and high levels of background noise often present in classrooms. As part of the EU EASEL project we have provided several contributions to address these challenges, implementing our own ASR module for use in robotics applications. We used the latest deep neural network algorithms which provide a leap in performance over the traditional GMM approach, and apply data augmentation methods to improve robustness to noise and speaker variation. We provide a close integration between the ASR module and the rest of the dialogue system, allowing the ASR to receive in real-time the language models relevant to the current section of the dialogue, greatly improving the accuracy. We integrated our ASR module into an interactive, multimodal system using a small humanoid robot to help children learn about exercise and energy. The system was installed at a public museum event as part of a research study where 320 children (aged 3 to 14) interacted with the robot, with our ASR achieving 90% accuracy for fluent and near-fluent speech.

研究の動機と目的

  • 騒音があり、現実世界の環境(例:教室)であるような条件下でも、子供とロボットの対話に耐障害性のあるASRシステムを開発すること。
  • 声帯の違い、発音のばらつき、不流暢さといった課題を克服し、子供の発話を認識すること。
  • データ拡張と深層ニューラルネットワーク(DNN)音響モデルを用いて、騒音環境下でのASR性能を向上させること。
  • ASRモジュールをマルチモーダル対話システムと動的に統合し、対話の状況(例:クイズの選択肢)に応じて言語モデルをリアルタイムで更新すること。
  • 子供(3歳から14歳)が参加する実際の公共の博物館環境で、システムを評価すること。

提案手法

  • Kaldiツールキットを用いて、従来のGMMアプローチに比べて最先端の深層ニューラルネットワーク(DNN)音響モデルを活用したASRモジュールを実装した。
  • 限られた学習データを考慮し、背景ノイズや話者差に強い耐性を高めるために、データ拡張技術を適用した。
  • ASRモジュールと対話システムを統合し、現在の対話段階(例:クイズの選択肢)に応じて言語モデルを動的に更新することで、認識精度を向上させた。
  • オンライン(ライブ)運用を想定した設計とし、インタラクティブロボットアプリケーションにおけるリアルタイム音声認識と低遅延応答を可能にした。
  • エンドポイント検出とセグメンテーションヒューリスティクスを用いて、発話の境界を特定したが、後続の手動分析でセグメンテーションエラーが確認された。
  • 実際の公共の博物館でシステムを展開し、人間型ロボットと対話した320名の子供からデータを収集した。

実験結果

リサーチクエスチョン

  • RQ1DNNベースのASRシステムは、騒音のある教室環境下で流暢な子供の発話を高い正確性で認識できるか?
  • RQ2リアルタイム言語モデル適応は、子供とロボットの対話システムにおける認識性能をどのように向上させるか?
  • RQ3データ拡張技術は、子供の発話認識におけるノイズと話者差のばらつきに対する耐性をどの程度高めるか?
  • RQ4ライブ状態の子供とロボットの対話において、主なセグメンテーションエラーの原因は何であり、認識正確性にどのように影響するか?
  • RQ5実際の展開において、年齢や性別によるグループごとのシステム性能にどのような差が生じるか?

主な発見

  • 本ASRシステムは、騒音のある博物館環境下で、ライブ状態の子供との対話において、流暢で語彙内発話に対して90%の認識正確性を達成した。
  • 最も頻度の高かったセグメンテーションエラーは「早期開始」であり、主にロボットの発話からの音声リードバックに起因しており、音声境界検出におけるタイミングの問題を示している。
  • 「早期終了」エラーは比較的低かった(116件)、これはシステムの低遅延により迅速な認識が可能であり、インタラクティブロボット対話に好都合であることを示している。
  • 「遅延終了」エラー(115件)は、主にASR認識の失敗に起因し、対話マネージャーのタイムアウトやロボットの過剰な応答を引き起こしていた。
  • 限られた学習データでも、データ拡張とDNNベース音響モデルの有効性が顕著に現れ、高い性能を発揮した。
  • 手動トランスクリプション分析により、認識エラーの大部分が、流暢な発話における誤った語の認識ではなく、セグメンテーションのずれに起因していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。