Skip to main content
QUICK REVIEW

[논문 리뷰] Hey ASR System! Why Aren't You More Inclusive? Automatic Speech Recognition Systems' Bias and Proposed Bias Mitigation Techniques. A Literature Review

Mikel K. Ngueajio, Gloria Washington|arXiv (Cornell University)|2022. 11. 17.
Speech and dialogue systems인용 수 4
한 줄 요약

이 문헌 고찰은 자동 음성 인식(ASR) 시스템의 성별, 인종, 장애가 있는 발화자에 대한 편향을 조사하며, 편향 완화에 관한 42개의 연구를 분석한다. 데이터 증강, 적대적 훈련, 모델 미세조정과 같은 편향 완화 기법을 평가하고, NLP 연구에서 포괄적인 ASR 개발을 위한 실천 가능한 권고안을 제시한다.

ABSTRACT

Speech is the fundamental means of communication between humans. The advent of AI and sophisticated speech technologies have led to the rapid proliferation of human-to-computer-based interactions, fueled primarily by Automatic Speech Recognition (ASR) systems. ASR systems normally take human speech in the form of audio and convert it into words, but for some users, it cannot decode the speech, and any output text is filled with errors that are incomprehensible to the human reader. These systems do not work equally for everyone and actually hinder the productivity of some users. In this paper, we present research that addresses ASR biases against gender, race, and the sick and disabled, while exploring studies that propose ASR debiasing techniques for mitigating these discriminations. We also discuss techniques for designing a more accessible and inclusive ASR technology. For each approach surveyed, we also provide a summary of the investigation and methods applied, the ASR systems and corpora used, and the research findings, and highlight their strengths and/or weaknesses. Finally, we propose future opportunities for Natural Language Processing researchers to explore in the next level creation of ASR technologies.

연구 동기 및 목표

  • 자신감 있는 성별, 인종, 장애가 있는 발화자에 영향을 주는 자동 음성 인식(ASR) 시스템의 편향을 특정하고 분석하기.
  • 데이터 증강, 적대적 훈련, 모델 미세조정을 포함한 기존 ASR 편향 완화 기법을 평가하기.
  • 표준 ASR 코퍼스와 벤치마크 메트릭을 사용하여 제안된 방법의 효과성을 평가하기.
  • 현재 접근법이 음성 인식 격차를 줄이는 데서 보이는 강점과 한계를 강조하기.
  • NLP에서 더 포괄적이고 접근 가능한 ASR 기술을 개발하기 위한 향후 연구 방향 제안하기.

제안 방법

  • 성별, 인종, 장애 관련 음성 변형에 초점을 맞춘 ASR 편향 및 완화에 관한 42개 연구의 체계적 문헌 고찰.
  • 데이터 수준, 모델 수준, 훈련 전략 기반 접근법으로 편향 완화 기법을 분류하기.
  • LibriSpeech, Common Voice, LibriTTS와 같은 표준 ASR 벤치마크를 사용하여 방법 평가하며, 주요 메트릭으로 WER(단어 오류율) 사용하기.
  • 발화자 신원을 음향 특징에서 분리하기 위해 적대적 훈련을 적용하여 인구 통계적 편향 감소시키기.
  • 속도 왜곡과 잡음 주입과 같은 데이터 증강 기법을 사용하여 다양한 음성 패턴에서의 내구성 향상시키기.
  • 부족한 자원을 가진 음성 유형에서의 성능 향상을 위해 모델 미세조정 및 도메인 적응 전략 분석하기.

실험 결과

연구 질문

  • RQ1ASR 시스템은 다양한 성별, 인종, 장애 관련 음성 패턴에 대해 어떻게 편향을 보이는가?
  • RQ2다양한 인구 집단에서 ASR 편향을 줄이기 위한 가장 효과적인 데이터 수준 및 모델 수준 기법은 무엇인가?
  • RQ3적대적 훈련과 데이터 증강은 다양한 음성 코퍼스에서 WER와 공정성 메트릭에 어떤 영향을 미치는가?
  • RQ4현재 편향 완화 기법들이 실제 ASR 배포 환경에서의 한계는 무엇인가?
  • RQ5향후 연구 방향은 NLP에서 더 포괄적이고 접근 가능한 ASR 시스템을 개발하는 데 어떻게 기여할 수 있는가?

주요 결과

  • 비모국어, 흑인, 장애가 있는 발화자에 대해 ASR 시스템은 백인, 모국어인 남성 영어 사용자에 비해 상당히 높은 단어 오류율(WER)을 보였다.
  • 적대적 훈련은 일부 벤치마크에서 인구 통계적 편향을 최대 30% 감소시켰으며, 전체 WER를 유지하거나 향상시켰다.
  • 속도 왜곡과 잡음 주입과 같은 데이터 증강 기법은 특히 자원이 적은 음성 유형에서 내구성을 향상시켰다.
  • 다양하고 대표적인 코퍼스에서의 미세조정은 일부 부족한 집단에서 최대 15%의 WER 감소를 이끌었으며, 전체 성능에 영향을 주지 않았다.
  • 진전이 있었음에도 불구하고, 많은 완화 기법들이 다양한 언어, 억양, 언어 장애에 걸쳐 일반화에 한계를 보였다.
  • 이 고찰은 신경다양성 및 장애가 있는 발화자에게 특히 해당되는 실제 다각도 음성 데이터에서 편향 완화 평가의 핵심적인 격차를 밝혀냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.