Skip to main content
QUICK REVIEW

[논문 리뷰] ATCO2 corpus: A Large-Scale Dataset for Research on Automatic Speech Recognition and Natural Language Understanding of Air Traffic Control Communications

Juan Zuluaga-Gómez, Karel Veselý|arXiv (Cornell University)|2022. 11. 08.
Natural Language Processing Techniques인용 수 14
한 줄 요약

이 논문은 4시간의 수동으로 전사 및 주석 처리된 음성, 5,281시간의 가짜 레이블이 부여된 ATC 음성, 그리고 무료로 제공되는 1시간 분량의 서브셋을 포함하는 대규모 공개 데이터셋인 ATCO2 코퍼스를 소개한다. 이는 강건한 자동 음성 인식(ASR) 및 자연어 이해(NLU) 연구를 가능하게 하며, 명칭 엔터티 인식 및 화자 역할 탐지에 BERT 기반 모델을 사용하여 성능을 입증했으며, 오직 가짜 레이블 데이터만을 사용해도 ASR 작업에서 경쟁적인 WER를 달성했다.

ABSTRACT

Personal assistants, automatic speech recognizers and dialogue understanding systems are becoming more critical in our interconnected digital world. A clear example is air traffic control (ATC) communications. ATC aims at guiding aircraft and controlling the airspace in a safe and optimal manner. These voice-based dialogues are carried between an air traffic controller (ATCO) and pilots via very-high frequency radio channels. In order to incorporate these novel technologies into ATC (low-resource domain), large-scale annotated datasets are required to develop the data-driven AI systems. Two examples are automatic speech recognition (ASR) and natural language understanding (NLU). In this paper, we introduce the ATCO2 corpus, a dataset that aims at fostering research on the challenging ATC field, which has lagged behind due to lack of annotated data. The ATCO2 corpus covers 1) data collection and pre-processing, 2) pseudo-annotations of speech data, and 3) extraction of ATC-related named entities. The ATCO2 corpus is split into three subsets. 1) ATCO2-test-set corpus contains 4 hours of ATC speech with manual transcripts and a subset with gold annotations for named-entity recognition (callsign, command, value). 2) The ATCO2-PL-set corpus consists of 5281 hours of unlabeled ATC data enriched with automatic transcripts from an in-domain speech recognizer, contextual information, speaker turn information, signal-to-noise ratio estimate and English language detection score per sample. Both available for purchase through ELDA at http://catalog.elra.info/en-us/repository/browse/ELRA-S0484. 3) The ATCO2-test-set-1h corpus is a one-hour subset from the original test set corpus, that we are offering for free at https://www.atco2.org/data. We expect the ATCO2 corpus will foster research on robust ASR and NLU not only in the field of ATC communications but also in the general research community.

연구 동기 및 목표

  • 항공 교통 관제(ATC) 커뮤니케이션 분야에서의 저자원 환경에서의 대규모 주석 처리된 데이터셋 부족 문제를 해결하기 위해.
  • 포괄적이고 공개 가능한 코퍼스를 제공하여 ATC 분야의 강건한 자동 음성 인식(ASR) 및 자연어 이해(NLU) 연구를 가능하게 하기 위해.
  • 기계 학습 기법을 활용한 자동 전사 및 가짜 주석 처리 파이프라인을 통해 데이터 수집 및 사전 처리 과정을 가속화하기 위해.
  • 공개 소스 GitHub 리포지터리에 훈련 및 데이터 준비 스크립트를 제공하여 ASR 및 NLU 작업에 대한 재현 가능한 베이스라인을 제공하기 위해.
  • 개인정보 보호법(GDPR) 준수를 확보하기 위해 음성 데이터를 익명화하고, 데이터 수집에 대한 공익적 정당성을 확보하기 위해.

제안 방법

  • ATCO2 코퍼스는 글로벌 범위의 자원봉사자 '데이터 피더' 네트워크를 통해 수집되었으며, 음성 사전 처리 및 자동 전사에 특화된 파이프라인을 통해 처리되었다.
  • 공동체 구성원인 '데이터 주석자'들이 SpokenData 플랫폼을 사용하여 명칭 엔터티(콜사인, 명령어, 값, 이름 없는 구문 포함)를 포함한 4시간 분량의 ATC 음성에 대해 골드 표준 주석을 생성했다.
  • ATCO2-PL-set 코퍼스는 자동 전사, 화자 전환 정보, 신호 대 잡음비 추정치, 언어 식별 점수를 포함한 5,281시간의 주석 없음 ATC 음성으로 구성되어 있다.
  • ATCO2-test-set-1h 코퍼스는 골드 주석 처리된 데이터의 무료 1시간 서브셋으로, https://www.atco2.org/data 에서 제공된다.
  • NER 및 화자 역할 탐지에 BERT 기반 모델을 사용하여 베이스라인을 개발하였으며, NER에 대해 3,000개의 발화 문장으로 훈련하였다.
  • ASR 베이스라인은 오직 가짜 레이블이 부여된 ATCO2-PL-set 코퍼스만을 사용하여 훈련되었으며, 공개 및 비공개 벤치마크에서 경쟁적인 단어 오류율(WER)을 달성했다.

실험 결과

연구 질문

  • RQ1골드 표준 전사 없이도 대규모 가짜 레이블이 부여된 ATC 음성 코퍼스가 경쟁적인 자동 음성 인식 성능을 달성할 수 있는가?
  • RQ2ATC 커뮤니케이션 분야에서 강건한 BERT 기반 명칭 엔터티 인식 시스템을 훈련하기 위해 필요한 최소한의 주석 처리된 데이터는 어느 정도인가?
  • RQ3BERT 기반 모델이 텍스트 기반 ATC 발화에서 화자 역할(예: ATCO 대비 조종사)을 효과적으로 탐지할 수 있는가?
  • RQ4자동화된 데이터 수집 및 사전 처리 파이프라인은 저자원 분야에서 주석 처리된 음성 코퍼스를 제작하는 데 소요되는 비용과 시간을 얼마나 줄일 수 있는가?
  • RQ5항공 교통 관제와 같은 민감한 분야에서 GDPR 준수 기반의 데이터 수집 및 익명화는 어떻게 달성할 수 있는가?

주요 결과

  • 골드 표준 전사가 없는 ATCO2-PL-set 코퍼스만을 사용하여 훈련한 ASR 시스템이 공개 및 비공개 ATC 음성 벤치마크에서 경쟁적인 단어 오류율(WER)을 달성했다.
  • ATC 커뮤니케이션 분야의 BERT 기반 명칭 엔터티 인식 시스템은 약 3,000개의 주석 처리된 발화 문장을 훈련 데이터로 사용할 경우 콜사인, 명령어, 값의 탐지에 효과적인 성능을 달성했다.
  • 골드 주석 처리된 데이터의 무료 1시간 서브셋인 ATCO2-test-set-1h 코퍼스는 연구 목적을 위해 공개적으로 제공되며, https://www.atco2.org/data 에서 접근할 수 있다.
  • ATCO2-PL-set 코퍼스는 자동 전사, 화자 전환 정보, 신호 대 잡음비 추정치를 포함한 5,281시간 이상의 ATC 음성으로 구성되어 있어 대규모 모델 훈련을 가능하게 한다.
  • BERT 기반 화자 역할 탐지 모델이 성공적으로 개발되었으며, 텍스트 입력을 기반으로 발화가 ATCO 또는 조종사에서 유래되었는지 분류하는 것이 가능함을 입증했다.
  • 자동 전사 및 가짜 주석 처리를 포함한 전체 데이터 수집 및 주석 처리 파이프라인은 성공적으로 구현되었으며, 공개 소스 GitHub 리포지터리인 https://github.com/idiap/atco2-corpus 를 통해 재현 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.