Skip to main content
QUICK REVIEW

[논문 리뷰] Contextual Semi-Supervised Learning: An Approach To Leverage Air-Surveillance and Untranscribed ATC Data in ASR Systems

Juan Zuluaga-Gómez, Iuliia Nigmatulina|arXiv (Cornell University)|2021. 04. 08.
Speech Recognition and Synthesis참고 문헌 29인용 수 6
한 줄 요약

이 논문은 항공기 감시 데이터를 ASR 학습에 통합하여 항공교통통제(ATC) 통신에서 호출부호 인식을 향상시키는 문맥 기반 준지도 학습(SSL) 프레임워크를 제안한다. 실시간 감시 데이터에서 추출한 발화된 호출부호를 기반으로 편향 WFST를 구성하고, SSL 동안 레이어스 재평가를 적용함으로써 노이즈가 있는 테스트 세트에서 상대적 CA-WER 성능을 17.5% 향상시켰으며, 이는 자원이 제한된 ATC ASR 환경에서 강력한 성능 향상을 보여준다.

ABSTRACT

Air traffic management and specifically air-traffic control (ATC) rely mostly on voice communications between Air Traffic Controllers (ATCos) and pilots. In most cases, these voice communications follow a well-defined grammar that could be leveraged in Automatic Speech Recognition (ASR) technologies. The callsign used to address an airplane is an essential part of all ATCo-pilot communications. We propose a two-steps approach to add contextual knowledge during semi-supervised training to reduce the ASR system error rates at recognizing the part of the utterance that contains the callsign. Initially, we represent in a WFST the contextual knowledge (i.e. air-surveillance data) of an ATCo-pilot communication. Then, during Semi-Supervised Learning (SSL) the contextual knowledge is added by second-pass decoding (i.e. lattice re-scoring). Results show that `unseen domains' (e.g. data from airports not present in the supervised training data) are further aided by contextual SSL when compared to standalone SSL. For this task, we introduce the Callsign Word Error Rate (CA-WER) as an evaluation metric, which only assesses ASR performance of the spoken callsign in an utterance. We obtained a 32.1% CA-WER relative improvement applying SSL with an additional 17.5% CA-WER improvement by adding contextual knowledge during SSL on a challenging ATC-based test set gathered from LiveATC.

연구 동기 및 목표

  • 실제 운영 환경에서 ASR 시스템 성능을 제한하는 수동으로 타이핑된 ATC 음성 데이터의 부족 문제를 해결하기 위해.
  • ATC 통신에서 핵심 식별자인 호출부호의 정확도를 향상시키기 위해 항공기 감시 데이터에서 유래한 문맥 지식을 활용하기 위해.
  • 특히 미사용 또는 자원이 제한된 공항에서 실시간 문맥 정보를 통합함으로써 준지도 학습이 어떻게 향상될 수 있는지 탐색하기 위해.
  • 호출부호 인식 성능 평가를 더 잘 반영하기 위해 새로운 평가 지표인 호출부호 단어 오류률(CA-WER)을 제안하고 검증하기 위해.
  • 다양한 공항과 도전적인 음향 조건에서 이 방법의 확장성을 입증하기 위해.

제안 방법

  • 각 ATC 발화문에 대해 OpenSky 네트워크 항공기 감시 데이터에서 추출한 발화된 호출부호의 n-그램 시퀀스를 기반으로 편향 WFST를 구성한다.
  • 두 번째 단계에서 레이어스 재평가를 통해 편향 WFST를 준지도 학습 파이프라인에 통합하여, 디코딩 그래프를 정확한 호출부호 시퀀스를 우선시하도록 수정한다.
  • 편향 강도를 제어하기 위해 WFST에 할인 파라미터를 사용하며, 최적의 값은 경험적으로 결정된다(예: 최고 성능를 위해 5.0).
  • LiveATC, 프라하, 비엔나 공항의 노이즈가 있는 및 깨끗한 녹음 자료를 포함한 여러 ASR 시스템과 테스트 세트에 이 방법을 적용한다.
  • 비타이핑된 VHF 녹음 자료를 SSL에서 가짜 레이블 데이터로 활용하면서, 디코딩 중에 항공기 감시 데이터를 통해 문맥 지식을 주입한다.
  • 표준 WER와 제안된 CA-WER 지표를 모두 사용하여 결과를 평가하며, 전적으로 호출부호 인식 정확도에 집중한다.

실험 결과

연구 질문

  • RQ1수동 타이핑된 데이터가 제한된 저자원 ATC 환경에서 항공기 감시 데이터로부터 유래한 문맥 지식이 ASR 성능 향상에 기여할 수 있는가?
  • RQ2준지도 학습 중에 문맥 지식을 통합할 경우, 단독 SSL보다 호출부호 인식 성능 향상이 이루어지는가?
  • RQ3학습 데이터에 포함되지 않은 새로운 공항에서 제안된 방법의 성능은 어떠한가?
  • RQ4표준 WER보다 호출부호 인식 성능 평가에 더 의미 있는가? CA-WER는 표준 WER보다 더 민감하고 관련성이 있는가?
  • RQ5다양한 테스트 세트에서 호출부호 인식 성능을 최적화하기 위해 편향 WFST의 할인 파라미터는 무엇인가?

주요 결과

  • 제안된 문맥 기반 SSL 접근법은 단독 SSL 대비 liveatc_mix 테스트 세트에서 상대적 CA-WER 성능을 17.5% 향상시켰으며, CA-WER를 39.88%에서 32.9%로 감소시켰다.
  • 최적 할인 파라미터(5.0)를 사용한 프라하 테스트 세트에서는 상대적 CA-WER 성능이 14% 향상되었으며, CA-WER는 3.48%에서 2.99%로 감소했다.
  • 데이터 품질 불일치로 인한 WER 악화가 일부 테스트 세트에서 관찰되었음에도 불구하고, 비엔나 테스트 세트에서는 여전히 상대적 CA-WER 성능이 7.5% 향상되어 강건성을 입증했다.
  • 노이즈가 많고 도메인이 다른 테스트 세트에서 단독 SSL 대비 뚜렷한 성능 향상을 보이며, 실제 환경 조건에 대한 강력한 일반화 능력을 입증했다.
  • CA-WER 지표는 표준 WER보다 호출부호 인식 성능 평가에 더 민감하고 관련성이 높다는 것이 입증되었다.
  • 편향 WFST의 최적 할인 파라미터는 5.0로, 과적합을 방지하면서 편향 강도와 시퀀스 길이 사이의 균형을 잘 맞추는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.