Skip to main content
QUICK REVIEW

[論文レビュー] Speech recognition for medical conversations

Chung‐Cheng Chiu, Anshuman Tripathi|arXiv (Cornell University)|Nov 20, 2017
Topic Modeling参考文献 12被引用数 11
ひとこと要約

本論文では、CTC(Connectionist Temporal Classification)およびLAS(Listen Attend and Spell)モデルを用いて、匿名化された臨床音声データ14,000時間の学習を経て、医師と患者の会話の音声認識を実現するエンド・ツー・エンドの音声認識システムを提示している。LASモデルは18.3%の語誤り率(WER)を達成し、ノイズの多いトランスクリプトに対しても強く耐性を示し、データクリーニングや言語モデルの適合を多用するCTCベースのモデルが20.1% WERに到達するのを上回った。

ABSTRACT

In this work we explored building automatic speech recognition models for transcribing doctor patient conversation. We collected a large scale dataset of clinical conversations ($14,000$ hr), designed the task to represent the real word scenario, and explored several alignment approaches to iteratively improve data quality. We explored both CTC and LAS systems for building speech recognition models. The LAS was more resilient to noisy data and CTC required more data clean up. A detailed analysis is provided for understanding the performance for clinical tasks. Our analysis showed the speech recognition models performed well on important medical utterances, while errors occurred in causal conversations. Overall we believe the resulting models can provide reasonable quality in practice.

研究の動機と目的

  • 実世界の医師と患者の医療会話のトランスクリプションを実現するスケーラブルな自動音声認識(ASR)システムの開発を目的とする。
  • 重複する会話、変動する音声品質、ドメイン特有の語彙を含むノイズ多きく、マルチスプーカーで長時間にわたる臨床会話の課題に対処することを目的とする。
  • ノイズの多いデータを処理し、臨床的に重要な内容を高精度に認識する能力について、CTCベースとエンド・ツー・エンドのLASモデルの有効性を比較することを目的とする。
  • 臨床文書作成に不可欠な、重要な医療用語や薬名認識の性能を評価することを目的とする。
  • エンド・ツー・エンドのモデルが、従来のCTCアプローチに比べ、手動によるデータクリーニングや外部言語モデルへの依存を低減できることを示すこと

提案手法

  • 文脈依存音素出力を用いたCTCベースのASRシステムを構築し、接続主義的時系列分類損失とFSTベースのデコーダーを採用した。
  • 双方向および単方向のCTCモデルをそれぞれ開発し、ドメインに適合したn-gram言語モデルと発音辞書を組み合わせた。
  • 自己注意機構を用いたエンコーダ・デコーダアーキテクチャを採用し、グラフームレベルのトランスクリプションを生成するエンド・ツー・エンドのLASモデルを実装した。
  • 14,000時間のコーパスにおけるアライメントとトランスクリプト品質の向上を目的として、2段階のデータセグメンテーションおよびクリーニング戦略を適用した。
  • LASモデルにおけるスケジューリングサンプリングとマルチヘッドアテンションを導入し、耐性性の向上と誤り率の低減を図った。
  • 性能最適化のため、MTR(モデルチューニングと再学習)およびEMBR(誤りモデリングとバックプロパゲーションの最適化)を含む広範なアブレーションスタディを実施した。

実験結果

リサーチクエスチョン

  • RQ1重複会話や変動する音声品質を伴うノイズの多い、実世界の医療会話データにおいて、CTCモデルとLASモデルの性能はどのように比較されるか?
  • RQ2CTCベースのモデルとエンド・ツー・エンドのLASモデルとを比較した場合、データ品質の影響はどの程度顕著か?
  • RQ3エンド・ツー・エンドのLASモデルは、外部言語モデルを必要とせずに、臨床的に重要なフレーズを高精度で認識できるか?
  • RQ4モデルは、特に薬名を含む重要な医療用語の認識において、どの程度効果的か?
  • RQ5データクリーニングおよび言語モデルの適合が、CTCベースのシステムとLASモデルの性能に与える寄与度はいかほどか?

主な発見

  • LASモデルは語誤り率(WER)18.3%を達成したのに対し、CTCモデルは膨大なデータクリーニングと言語モデル統合を経て20.1% WERに到達した。
  • LASモデルはノイズの多いトランスクリプトに対しても耐性を示し、外部言語モデルを必要としなかった。一方、CTCモデルは、妥当な性能を得るためには顕著なデータ前処理と適合された言語モデルの導入が不可欠であった。
  • 臨床的に重要なフレーズに関しては、双方向モデルを用いたCTCモデルが、適合率92%、再現率86%を達成し、重要な医療コンテンツの認識において優れた性能を示した。
  • LASモデルは治療関連の薬名認識において98.2%の再現率を達成し、臨床的に重要な用語の認識効果が顕著に高まった。
  • 誤り分析の結果、CTCモデルは特に1秒未塔の短い発話、重複会話、および不順応な発話に対して苦労し、しばしば会話的で自然な内容を削除または誤って記録していた。
  • LASモデルの主な誤りは、一般的な語の音声モデル化に起因しており(例:'Don’t pay a penny' → 'Don’t byetta penny')、言語パターンを効果的に学習しているが、類似発音語を混同する傾向があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。