[論文レビュー] Clarity: Machine Learning Challenges to Revolutionise Hearing Device Processing
Clarityプロジェクトは、聴覚障害を有する人々における音声認識の向上と、聴覚障害者向けの音声認識の予測を目的とした、オープンかつ公開の機械学習チャレンジを開始した。オープンデータセット、ベースラインモデル、インfra構造を提供することで、研究者が因果的かつリアルタイムな補聴器信号処理および予測アルゴリズムを開発できる環境を整えた。主な成果として、新規のオープンソースツール、イギリス英語の音声・ノイズ環境下でのデータベース、実世界における補聴器性能を向上させるアルゴリズムが得られた。
In the Clarity project, we will run a series of machine learning challenges to revolutionise speech processing for hearing devices. Over five years, there will be three paired challenges. Each pair will consist of a competition focussed on hearing-device processing ("enhancement") and another focussed on speech perception modelling ("prediction"). The enhancement challenges will deliver new and improved approaches for hearing device signal processing for speech. The parallel prediction challenges will develop and improve methods for predicting speech intelligibility and quality for hearing impaired listeners. This Engineering and Physical Sciences Research Council (EPSRC) funded project involves researchers from the Universities of Sheffield, Salford, Nottingham and Cardiff in conjunction with the Hearing Industry Research Consortium, Action on Hearing Loss, Amazon, and Honda. To register interest in the challenges, go to www.claritychallenge.org.
研究の動機と目的
- 聴覚障害者における音声・ノイズ環境下での認識困難は、補聴器使用の主な要因であるため、その解決を図る。
- 聴覚障害分野における研究関心の低さという障壁を克服するため、機械学習および信号処理研究者にとってアクセス可能なオープンリソースを提供する。
- ディープラーニングおよび自動音声認識分野の進展を活用して、公共のコンペティションを通じて補聴器処理を画期的に革新する。
- 多様な聴取環境における実際の補聴器性能を的確に反映するように、音声認識の予測モデルを開発する。
- オープンアクセスのデータ、モデル、インfra構造を提供することで、聴覚技術分野における持続的かつ長期的な研究エコシステムを構築する。
提案手法
- 補聴器信号強化(因果的処理)に焦点を当てたチャレンジと、聴覚障害者向けの音声認識を予測するチャレンジの2つのペアドMLチャレンジを実施する。
- 空間的音声生成ツールを用いて、リバーブとテレビなどの非音声干渉要因を含むリビングルーム環境を再現したリアルなバイナリ音声・ノイズ信号を生成する。
- 聴覚障害、補聴器処理、音声認識のベースラインモデルを提供し、評価の標準化と参画の障壁低減を図る。
- 聴覚障害の有無を問わず50名の聴取者パネルを用意し、タブレットとヘッドフォンを用いた自宅での聴取テストを通じて、実際の音声認識スコアを収集する。
- 信号強化のエントリは、テスト信号全体における平均認識スコアに基づき評価する。予測エントリは、予測された認識スコアと測定された認識スコアとの間の平均二乗誤差(MSE)を用いて評価する。
- 再現可能性とアクセス可能性を確保するため、可能な限りシステムのオープンアクセスを要請し、提供された音声ファイルおよび信号生成ツールの使用を義務付ける。
実験結果
リサーチクエスチョン
- RQ1実際の騒音環境およびリバーブを伴う条件下で、機械学習モデルをどのようにして補聴器における音声認識を著しく向上させることができるか?
- RQ2信号処理および聴取者特性に基づいて、聴覚障害者向けの音声認識をどれほど正確に予測モデルが推定できるか?
- RQ3オープンアクセスのデータセット、ツール、インfra構造は、補聴器技術分野におけるイノベーションをどのように促進し、研究者の参加を拡大するのか?
- RQ4標準化されたベンチマークおよび評価プロトコルを備えた公共のチャレンジは、補聴器信号処理および認識モデリングにおける測定可能な改善をもたらすのか?
- RQ5自動音声認識分野におけるディープラーニングおよびデータ駆動型アプローチは、聴覚障害用途にどのように適合され、妥当性が検証されるのか?
主な発見
- Clarityプロジェクトは2020年11月に第1ラウンドの機械学習チャレンジを成功裏に開始し、2020年10月にベータ版がリリースされた。
- 聴覚障害の程度が異なる50名の聴取者が自宅での聴取テストに参加し、評価用の実測音声認識スコアを提供した。
- プロジェクトは、アネクソイック環境下でのイギリス英語の音声記録および現実的な部屋の音響特性を再現した空間的音声・ノイズ信号を含むオープンアクセスデータセットを提供した。
- 聴覚障害、補聴器処理、音声認識のベースラインモデルが開発され、一貫したベンチマーク評価を支援する目的で公開された。
- 人工聴取者プロファイルおよびバイナリ音声信号を生成するための再利用可能なツールを整備することで、今後のチャレンジに向けた持続可能なフレームワークを確立した。
- 包括的なインfra構造を提供することで、聴覚技術分野の経験がなくても研究者が参加可能となるように、参画の障壁を低減した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。