Skip to main content
QUICK REVIEW

[論文レビュー] Improving callsign recognition with air-surveillance data in air-traffic communication

Iuliia Nigmatulina, Rudolf Braun|arXiv (Cornell University)|Aug 27, 2021
Speech Recognition and Synthesis参考文献 18被引用数 9
ひとこと要約

本稿では、航空交通管制(ATC)音声における航空機呼称認識を、リアルタイムの空域監視データを自動音声認識(ASR)デコード処理に統合することで動的に改善する手法を提案する。2つの手法—G-ブースティング(動的言語モデル重み付け)およびラティス再スコアリングによる呼称n-gramブースティング—を用いることで、呼称認識精度が28.4%絶対的に向上し、語誤り率(WER)は最大74.2%相対的に低減され、安全に重要な通信の信頼性が顕著に向上する。

ABSTRACT

Automatic Speech Recognition (ASR) can be used as the assistance of speech communication between pilots and air-traffic controllers. Its application can significantly reduce the complexity of the task and increase the reliability of transmitted information. Evidently, high accuracy predictions are needed to minimize the risk of errors. Especially, high accuracy is required in recognition of key information, such as commands and callsigns, used to navigate pilots. Our results prove that the surveillance data containing callsigns can help to considerably improve the recognition of a callsign in an utterance when the weights of probable callsign n-grams are reduced per utterance. In this paper, we investigate two approaches: (1) G-boosting, when callsigns weights are adjusted at language model level (G) and followed by the dynamic decoder with an on-the-fly composition, and (2) lattice rescoring when callsign information is introduced on top of lattices generated using a conventional decoder. Boosting callsign n-grams with the combination of two methods allowed us to gain 28.4% of absolute improvement in callsign recognition accuracy and up to 74.2% of relative improvement in WER of callsign recognition.

研究の動機と目的

  • ノイズ、発音の違い、発話のばらつきの影響により、航空交通管制(ATC)通信における呼称認識の誤り率が高くなる問題に対処すること。
  • 航空機識別および航行に不可欠な、ATCの主要なコマンド、特に呼称の認識精度を向上させること。
  • 現在有効な呼称を含むリアルタイムの空域監視データ—現在アクティブな呼称を含む—をASRデコード処理に統合し、有効で範囲内にある呼称の認識を強化すること。
  • G-ブースティング(文法レベルの重み調整)およびラティス再スコアリング(後処理による精緻化)という2つの動的統合手法の有効性を評価すること。
  • 文脈に即したレーダー監視データを用いることで、ドメイン特化言語モデルや事前文法アノテーションを必要とせずに、ASR性能を顕著に向上させられることを示すこと。

提案手法

  • G-ブースティングは、現在レーダー登録済みの呼称に基づいて、言語モデル(G)内の呼称n-gramの確率を動的に調整することで、それらの重みを変更する。
  • 修正されたG.fstを、有限状態トランスダクタ(FST)を用いて、デコードグラフの残りの部分と即座に合成し、発話ごとにリアルタイムで適合可能にする。
  • ラティス再スコアリングは、ベースラインASRシステムから得られた語ラティスを再スコアリングし、有効な呼称n-gramをブーストする監視ベースのFSTと合成する。
  • 監視FSTは、レーダーデータに含まれる現在アクティブなすべての呼称から構築され、すべての可能な発音的展開(例:'DLH5KX' を 'lufthansa five kilo x-ray' として)を考慮する。
  • 両手法を組み合わせることで最高の性能を達成し、ハイブリッド手法は多様なテストセットにおいて優れた結果を示す。
  • 動的文脈統合を効率的に処理し、デコード効率を維持するために、重み付き有限状態トランスダクタ(WFST)を用いる。

実験結果

リサーチクエスチョン

  • RQ1リアルタイムの空域監視データを用いて、ATC音声における航空機呼称認識精度を向上させることができるか?
  • RQ2監視データを用いた呼称n-gramの動的ブースティングは、従来のASRデコード処理と比較して、WERおよび呼称認識精度の面でどの程度優れているか?
  • RQ3G-ブースティングとラティス再スコアリングを組み合わせることで、呼称認識のための全体的なASR性能にどのような影響を与えるか?
  • RQ4異なる音声品質レベルや録音環境下でも、提案手法はどの程度の耐障害性を示すか?
  • RQ5ブースト対象の呼称数が、認識精度および誤検出のリスクにどの程度の影響を与えるか?

主な発見

  • G-ブースティングとラティス再スコアリングの組み合わせにより、ベースラインシステムと比較して呼称認識精度が28.4%絶対的に向上した。
  • 最良の手法では、呼称の語誤り率(WER)が最大74.2%相対的に低減され、顕著な耐障害性の向上が示された。
  • 1発話あたり最大29のアクティブ呼称が存在しても、システムは高い認識精度を維持し、n-gramブースティングの増加に対してもスケーラビリティと耐障害性を示した。
  • ライブATC(低品質)およびマロルカ(高品質)からの録音を含む多様なテストセットにおいて、一貫した改善が得られ、一般化性能が優れていることが示された。
  • G-ブースティングは動的FST再合成に起因してメモリ使用量が高くなるが、ラティス再スコアリングに必要な追加の再スコアリングプロセスがないため、推論速度が速かった。
  • 真値呼称を用いたオラクル性能は常に優れていたが、完全な監視データを用いたシステムはそれに近く、本手法の実用的妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。