[論文レビュー] Global Performance Disparities Between English-Language Accents in Automatic Speech Recognition
本研究は、171か国から2,713人の話者を含むグローバルなデータセットを用いて、主な英語圏の音声認識(ASR)サービスを監査した。その結果、米国から地理的・政治的に距離のある国にルーツを持つ話者の間で、言語的共変量を補正しても性能が著しく低下することが明らかになった。主な発見は、話者の母国の政治的立場と関連した統計的に有意なバイアスが存在することであり、言語の複雑さだけではなく、歴史的権力構造に根ざした制度的差別を示唆している。
Past research has identified discriminatory automatic speech recognition (ASR) performance as a function of the racial group and nationality of the speaker. In this paper, we expand the discussion beyond bias as a function of the individual national origin of the speaker to look for bias as a function of the geopolitical orientation of their nation of origin. We audit some of the most popular English language ASR services using a large and global data set of speech from The Speech Accent Archive, which includes over 2,700 speakers of English born in 171 different countries. We show that, even when controlling for multiple linguistic covariates, ASR service performance has a statistically significant relationship to the political alignment of the speaker's birth country with respect to the United States' geopolitical power. This holds for all ASR services tested. We discuss this bias in the context of the historical use of language to maintain global and political power.
研究の動機と目的
- 話者の母国と米国との間の地政学的関係が、ASR性能に系統的に影響を与えるかどうかを調査すること。
- 大規模かつ多様なグローバルな英語アクセントデータセットを用いて、主要な商用ASRサービスを監査すること。
- 第一言語や発音タイプなどの言語的共変量が、ASR性能格差を完全に説明できるかどうかを検討すること。
- 観察されたASRバイアスを、言語に基づく権力と植民地主義の歴史的パターンの文脈に位置づけること。
- ASRバイアスは、単にデータ収集を増やすことで自然に解消するという仮定に疑問を呈すること。
提案手法
- 本研究は、171か国から2,700人以上の話者が登録された公開データセット『The Speech Accent Archive』を用い、各話者の録音データと人口統計的メタデータを含む。
- ASRサービス(例:Google、Microsoft、Amazon、IBM)は、各話者の音声に対する語誤り率(WER)を評価した。
- 言語的共変量として、第一言語、L1の声調言語状態、L1における英語の習得度を制御する統計的モデリングを実施した。
- 地政学的連携は、NATO加盟状況と米国の歴史的外国政策連携に基づいて操作化され、非加盟または敵対的立場の国々は米国の影響圏から距離があるとコード化された。
- 多変量回帰モデルを用いて、地政学的距離とASR WERの関係を、言語的および人口統計的要因を調整した上で分析した。
- 妥当性を確認するため、レジラントネスチェックとサブグループ分析を実施し、異なるASRプロバイダーおよび話者グループにおいて地政学的要因の影響が一貫しているかを検証した。
実験結果
リサーチクエスチョン
- RQ1話者の母国と米国との地政学的関係が、ASR性能に影響を与えるか?
- RQ2第一言語や声調言語L1といった言語的共変量が、ASRシステムにおける性能格差をどの程度説明できるか?
- RQ3観察された性能格差は、複数の商用ASRサービスに共通して見られるか?
- RQ4英語が植民地的・グローバルな権力の道具として使われてきた歴史と、現在のASRバイアスとの関連は何か?
- RQ5観察されたバイアスは、データ不足に起因するものか、それとも言語と権力の根本的な構造的不平等に根ざしているのか?
主な発見
- 全テスト対象ASRサービスにおいて、米国から地理的・政治的に距離のある国にルーツを持つ話者に対して、言語的要因を補正しても語誤り率(WER)が著しく高くなる傾向が見られた。
- NATO加盟国でない国々、特に米国敵対国と歴史的に連携した国々の話者ほど、NATO加盟国に属する話者に比べてASR性能が著しく劣ることが確認された。
- 第一言語、声調言語L1、L1英語習得度を調整しても、性能格差が依然として残っていることから、言語の複雑さだけではその格差を説明できないことが示された。
- 本研究では、ASRバイアスが単にデータ収集を増やすことで自然に解消するという証拠は得られず、訓練データ内の既存の不平等を強化するフィードバックループが存在することが示唆された。
- 結果から、ASRバイアスは単なるデータの不均衡という技術的問題ではなく、歴史的かつ地政学的権力構造と系統的に関連している可能性が示された。
- これらの発見は、改善されたデータ収集が自然にASR格差を是正するという技術的楽観主義を疑問視し、アルゴリズム的バイアスの背後に潜む構造的・政治的側面を強調している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。