Skip to main content
QUICK REVIEW

[論文レビュー] ATCO2 corpus: A Large-Scale Dataset for Research on Automatic Speech Recognition and Natural Language Understanding of Air Traffic Control Communications

Juan Zuluaga-Gómez, Karel Veselý|arXiv (Cornell University)|Nov 8, 2022
Natural Language Processing Techniques被引用数 14
ひとこと要約

本論文では、4時間の手動で文字起こし・アノテーションされた音声、5,281時間の疑似ラベル付きATC音声、および無料の1時間分のサブセットを含む大規模かつ公開可能な空港管制(ATC)通信のデータセット、ATCO2コーパスを紹介する。このデータセットは、耐障害性のある自動音声認識(ASR)および自然言語理解(NLU)分野における研究を可能にし、命名エンティティ認識および発話者役割検出においてBERTベースのモデルを用いて優れた性能を示した。ASRタスクでは、完全に疑似ラベル付きデータのみを用いても、競争力のある語誤り率(WER)を達成した。

ABSTRACT

Personal assistants, automatic speech recognizers and dialogue understanding systems are becoming more critical in our interconnected digital world. A clear example is air traffic control (ATC) communications. ATC aims at guiding aircraft and controlling the airspace in a safe and optimal manner. These voice-based dialogues are carried between an air traffic controller (ATCO) and pilots via very-high frequency radio channels. In order to incorporate these novel technologies into ATC (low-resource domain), large-scale annotated datasets are required to develop the data-driven AI systems. Two examples are automatic speech recognition (ASR) and natural language understanding (NLU). In this paper, we introduce the ATCO2 corpus, a dataset that aims at fostering research on the challenging ATC field, which has lagged behind due to lack of annotated data. The ATCO2 corpus covers 1) data collection and pre-processing, 2) pseudo-annotations of speech data, and 3) extraction of ATC-related named entities. The ATCO2 corpus is split into three subsets. 1) ATCO2-test-set corpus contains 4 hours of ATC speech with manual transcripts and a subset with gold annotations for named-entity recognition (callsign, command, value). 2) The ATCO2-PL-set corpus consists of 5281 hours of unlabeled ATC data enriched with automatic transcripts from an in-domain speech recognizer, contextual information, speaker turn information, signal-to-noise ratio estimate and English language detection score per sample. Both available for purchase through ELDA at http://catalog.elra.info/en-us/repository/browse/ELRA-S0484. 3) The ATCO2-test-set-1h corpus is a one-hour subset from the original test set corpus, that we are offering for free at https://www.atco2.org/data. We expect the ATCO2 corpus will foster research on robust ASR and NLU not only in the field of ATC communications but also in the general research community.

研究の動機と目的

  • 空港管制(ATC)通信分野における大規模かつアノテーション済みのデータセットが不足しているという問題に対処すること。
  • 包括的かつ公開可能なコーパスをリリースすることで、ATC分野における耐障害性のある自動音声認識(ASR)および自然言語理解(NLU)の研究を促進すること。
  • 機械学習技術、特に自動文字起こしおよび疑似ラベル付与パイプラインを用いて、データ収集および事前処理を加速すること。
  • オープンソースのGitHubリポジトリを通じて、トレーニングおよびデータ準備スクリプトを提供することで、ASRおよびNLUタスクの再現可能なベースラインを提供すること。
  • 個人情報保護に関する規則(GDPR)への準拠を確保するため、音声データを匿名化し、データ収集の正当性を公共の利益に基づいて説明すること。

提案手法

  • ATCO2コーパスは、世界中のボランティアによる「データフィーダー」ネットワークを介して収集され、音声の事前処理および自動文字起こしに特化したカスタムパイプラインで処理された。
  • 「データアノテーター」のコミュニティがSpokenDataプラットフォームを用い、名前付きエンティティ(呼称、命令、値、未名詞フレーズ)を含む、4時間分のATC音声のゴールドスタンダードアノテーションを生成した。
  • ATCO2-PL-setコーパスは、自動文字起こし、発話者ターン情報、信号対雑音比推定値、言語検出スコアを含む、ラベルなしATC音声約5,281時間分を含む。
  • ATCO2-test-set-1hコーパスは、ゴールドアノテーション済みデータの無料1時間分のサブセットであり、https://www.atco2.org/data にホスティングされている。
  • ベースラインは、命名エンティティ認識(NER)および発話者役割検出のためのBERTベースのモデルを用い、NERには3,000発話分のデータで学習した。
  • ASRベースラインは、完全に疑似ラベル付きのATCO2-PL-setコーパスのみを用いて学習され、公開および非公開のベンチマークで競争力のある語誤り率(WER)を達成した。

実験結果

リサーチクエスチョン

  • RQ1ゴールドスタンダード文字起こしのない大規模な疑似ラベル付きATC音声コーパスは、競争力のある自動音声認識性能を達成できるか?
  • RQ2ATC通信における耐障害性のあるBERTベースの命名エンティティ認識システムを訓練するのに必要な最小限のアノテーション済みデータ量はどの程度か?
  • RQ3BERTベースのモデルは、テキストによるATC発話から発話者役割(例:管制官対パイロット)を効果的に検出できるか?
  • RQ4自動化されたデータ収集および事前処理パイプラインは、低リソース分野におけるアノテーション付き音声コーパス作成のコストと時間をどの程度削減できるか?
  • RQ5空港管制のような機微な分野では、GDPR準拠のデータ収集および匿名化をどのように達成できるか?

主な発見

  • ゴールドスタンダード文字起こしのない、疑似ラベル付きのATCO2-PL-setコーパスのみを用いてASRシステムを学習したところ、公開および非公開のATC音声ベンチマークで競争力のある語誤り率(WER)を達成した。
  • ATC通信におけるBERTベースの命名エンティティ認識システムは、約3,000件のアノテーション済み発話分のデータで、呼称、命令、値の検出において効果的な性能を発揮した。
  • ATCO2-test-set-1hコーパスは、ゴールドアノテーション済みデータの無料1時間分のサブセットであり、研究利用を目的としてhttps://www.atco2.org/data で公開されている。
  • ATCO2-PL-setコーパスには、自動文字起こし、発話者ターン情報、信号対雑音比推定値を含む、5,281時間以上のATC音声が含まれており、大規模なモデル学習を可能にしている。
  • BERTベースの発話者役割検出モデルが正常に開発され、テキスト入力からの管制官またはパイロット発話の分類が可能であることが実証された。
  • 自動文字起こしおよび疑似ラベル付与を含む、全般的なデータ収集およびアノテーションパイプラインは、オープンソースのGitHubリポジトリ(https://github.com/idiap/atco2-corpus)を通じて正常に展開され、再現可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。