Skip to main content
QUICK REVIEW

[論文レビュー] A Benchmarking on Cloud based Speech-To-Text Services for French Speech and Background Noise Effect

Binbin Xu, Chongyang Tao|arXiv (Cornell University)|May 7, 2021
Speech Recognition and Synthesis参考文献 10被引用数 10
ひとこと要約

本研究では、40,158件の音声ファイル(約101時間)にわたるフランス語音声を対象に、Google Cloud、Microsoft Azure、Amazon Transcribe、IBM Watson の4つのクラウドベースの音声認識(STT)サービスをベンチマークした。ノイズレベルは40 dBから0 dB SNRの5段階にわたり、Microsoft Azure が中央値語誤り率(WER)が最も低く(9.09%)、特に低SNR条件下でも優れたノイズ耐性を示した。

ABSTRACT

This study presents a large scale benchmarking on cloud based Speech-To-Text systems: {Google Cloud Speech-To-Text}, {Microsoft Azure Cognitive Services}, {Amazon Transcribe}, {IBM Watson Speech to Text}. For each systems, 40158 clean and noisy speech files about 101 hours are tested. Effect of background noise on STT quality is also evaluated with 5 different Signal-to-noise ratios from 40dB to 0dB. Results showed that {Microsoft Azure} provided lowest transcription error rate $9.09\%$ on clean speech, with high robustness to noisy environment. {Google Cloud} and {Amazon Transcribe} gave similar performance, but the latter is very limited for time-constraint usage. Though {IBM Watson} could work correctly in quiet conditions, it is highly sensible to noisy speech which could strongly limit its application in real life situations.

研究の動機と目的

  • 多言語STT評価における空白を埋めるために、フランス語向けの大規模なクラウドベースSTTサービスのベンチマークを実施すること。
  • 特に信号対雑音比(SNR)の変動に伴う背景ノイズのSTTパフォーマンスへの影響を評価すること。
  • 実世界の条件下で、4つの主要STT API の応答時間、誤り率、耐性性能を比較すること。
  • フランス語アプリケーションにノイズ制約がある場合の開発者や組織がSTTサービスを選定する上で実用的なインサイトを提供すること。

提案手法

  • クリアなフランス語音声データとして6,693件(約17時間)を収集・処理し、18種類の背景ノイズを5段階のSNR(40 dB ~ 0 dB)で重ね合わせ、33,465件のノイズありバージョンを生成した。
  • Google Cloud Speech-to-Text、Microsoft Azure Cognitive Services、Amazon Transcribe、IBM Watson Speech to Text の4つのクラウドベースSTT API を使用した。
  • 全40,158件の音声ファイル(合計101時間)を一括処理し、語誤り率(WER)、ジョブ完了時間、誤りタイプの分布を測定した。
  • 標準指標を適用:WERの中央値と四分位範囲、誤りタイプ分析(置換、削除、挿入)、1ジョブあたりの応答時間。
  • 42名の異なるフランス語話者を対象に、話者間のばらつきを評価した。
  • ノイズ耐性の評価にSNRを主要変数として用い、各SNRレベルと各サービスごとに結果を集計した。

実験結果

リサーチクエスチョン

  • RQ14つの主要クラウドベースSTTサービスは、変動するノイズレベルにおけるフランス語音声の語誤り率(WER)でどの程度の性能を示すか?
  • RQ2特に低SNR(例:0–10 dB)条件下で、背景ノイズに対して最も高い耐性を示すSTTサービスはどれか?
  • RQ3音声の長さと各STTサービスにおけるトランスクリプションジョブ完了時間の関係は何か?
  • RQ4ノイズレベルの上昇に伴い、誤りタイプ(置換、削除、挿入)は、異なるSTTプロバイダー間でどのように変化するか?
  • RQ5応答時間やシステム制約(例:Amazon S3への依存)が、リアルタイムまたは時間制約のあるアプリケーションに与える実用的影響は何か?

主な発見

  • Microsoft Azure はクリアなフランス語音声において中央値WERが最も低く、9.09%であった。これは、Google Cloud(11.76%)、Amazon Transcribe(14.00%)、IBM Watson(14.29%)を上回った。
  • Microsoft Azure はノイズ耐性も高く、0 dB SNR でも中央値WERが16.67%にしか上昇しなかった。これに対して、IBM Watson は同条件で約70%にまで上昇し、著しく劣化した。
  • Google Cloud は最も高速なSTTサービスであり、1音声ファイルあたりの中央値ジョブ完了時間が1.76秒であった。次いで Microsoft Azure(3.51 s)、IBM Watson(5.43 s)、Amazon Transcribe(27.00 s)であった。
  • Amazon Transcribe は1ジョブあたりの遅延が最も長く、平均27秒であった。また、音声をAmazon S3にアップロードする必要があり、大規模なバッチ処理では複雑さと遅延が増加した。
  • クリアな音声および中程度のノイズあり音声では、置換誤りが最も顕著であった。SNR < 10 dB では削除誤り率が著しく上昇し、特にIBM Watson と Amazon Transcribe で顕著だった。
  • レストランノイズは、全STTサービスにおいて最も挑戦的なノイズタイプであり、全プロバイダーでWERが著しく上昇した。特にIBM Watson と Amazon Transcribe で顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。