[论文解读] Gender in Danger? Evaluating Speech Translation Technology on the MuST-SHE Corpus
本文提出了 MuST-SHE,一个用于评估语音翻译(ST)中性别偏见的多语言基准,比较了英语到意大利语和英语到法语方向的级联式与端到端 ST 系统。研究发现,端到端模型能更好地利用音频线索,在说话者自我指涉语境中减少性别偏见,而级联模型则依赖外部性别标签实现类似效果,凸显了音频在缓解 ST 中性别偏见方面的潜力。
Translating from languages without productive grammatical gender like English into gender-marked languages is a well-known difficulty for machines. This difficulty is also due to the fact that the training data on which models are built typically reflect the asymmetries of natural languages, gender bias included. Exclusively fed with textual data, machine translation is intrinsically constrained by the fact that the input sentence does not always contain clues about the gender identity of the referred human entities. But what happens with speech translation, where the input is an audio signal? Can audio provide additional information to reduce gender bias? We present the first thorough investigation of gender bias in speech translation, contributing with: i) the release of a benchmark useful for future studies, and ii) the comparison of different technologies (cascade and end-to-end) on two language directions (English-Italian/French).
研究动机与目标
- 探究语音翻译系统是否能通过利用音频信号来减少性别偏见,这些音频信号可能包含文本输入中缺失的说话者性别线索。
- 解决当前缺乏自然、平衡且细粒度的语音翻译性别偏见评估基准的问题。
- 比较级联式(ASR + MT)与端到端 ST 系统在性别化语言现象中的表现,特别是在说话者自我指涉语境中。
- 发布 MuST-SHE,一个公开可用的多语言基准,包含约 1,000 个标注的音频-转录-翻译三元组,覆盖英语-法语和英语-意大利语。
- 开发一种优化的评估方法,将性别相关性能与整体系统准确率分离,以实现更精确的偏见测量。
提出的方法
- 作者创建了 MuST-SHE,即 MuST-C 语料库的一个子集,包含约 1,000 个(音频、转录、翻译)三元组,针对英语-意大利语和英语-法语两个语对中的性别相关现象进行了标注。
- 该语料库分为两类:类别 1(说话者指称自己)和类别 2(说话者指称他人),以支持对说话者相关与第三方性别线索的分析。
- 研究评估了级联 ST(ASR + MT)和端到端 ST 系统,后者直接在音频-文本对上进行训练,以利用声学特征。
- 引入了一种新颖的评估协议,使用 'Diff' 指标通过比较男性与女性性别类别上的表现来衡量性别偏见。
- 对于级联系统,采用了一种类 oracle 变体(Cascade+Tag),通过外部标签注入说话者性别信息,以评估此类知识的影响。
- 评估聚焦于性别特定的翻译错误,特别是在代词和名词一致方面,使用经过调整的 BLEU 分数以隔离性别相关性能。
实验结果
研究问题
- RQ1语音翻译系统能否利用音频信号减少翻译中的性别偏见,特别是在文本中未明确呈现性别信息的情况下?
- RQ2在音频可能提供说话者身份线索的说话者自我指涉性别现象中,端到端 ST 系统与级联 ST 系统的表现如何比较?
- RQ3通过标签注入说话者性别信息在多大程度上能提升级联系统在性别化翻译中的表现?
- RQ4ST 系统在不同性别现象中的表现如何变化,特别是在性别需从语篇推断而非依赖音频线索的语境中?
- RQ5与仅使用文本的机器翻译相比,ST 系统使用音频输入是否能显著降低性别偏见,特别是在具有丰富性别一致系统的语言中?
主要发现
- 在类别 1(说话者自我指称)中,端到端 ST 系统优于级联系统,音频线索可揭示说话者性别,实现显著更低的性别偏见('Diff' 值更低),尤其在女性类别中表现更优。
- 级联系统在类别 1 中表现出强烈的性别偏见,尤其偏好男性形式,女性类别上的负向 'Diff' 值表明存在系统性误译。
- 在类别 2(指称他人)中,性别信息存在于文本中,端到端系统表现不如级联系统,可能由于训练数据较少且缺乏鲁棒的音频特征用于性别识别。
- Cascade+Tag 系统在类别 1 中表现最佳,表明外部性别知识可弥补缺乏基于音频的推断能力。
- MuST-SHE 基准揭示,当说话者性别与翻译目标性别不一致时,如 End2End 和 Cascade+Tag 等系统尤其面临挑战,原因可能是基于音频的性别信号存在噪声或误导。
- 本研究证实,当前 ST 系统仍受性别偏见影响,但音频输入在说话者自我指称语境中具有实际优势,表明若合理利用,音频可帮助缓解偏见。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。