Skip to main content
QUICK REVIEW

[论文解读] Is there Gender bias and stereotype in Portuguese Word Embeddings?

Brenda Salenave Santana, Vinicius Woloszyn|arXiv (Cornell University)|Oct 10, 2018
Gender Studies in Language参考文献 2被引用 7
一句话总结

本研究使用预训练的CBOW word2vec模型,探究葡萄牙语词嵌入中的性别偏见,并应用受英语语言方法启发的几何去偏方法。尽管去偏后准确率从18.18%显著下降至3.03%,结果仍揭示出强烈的性别刻板印象——特别是将女性职业与性化角色关联——凸显了在葡萄牙语等低资源语言中针对性缓解偏见的必要性。

ABSTRACT

In this work, we propose an analysis of the presence of gender bias associated with professions in Portuguese word embeddings. The objective of this work is to study gender implications related to stereotyped professions for women and men in the context of the Portuguese language.

研究动机与目标

  • 探究葡萄牙语词嵌入中是否存在性别偏见及职业刻板印象。
  • 量化预训练葡萄牙语word2vec模型中的直接与间接性别偏见。
  • 评估几何去偏方法对模型准确率与偏见减少的影响。
  • 探讨针对英语语言开发的去偏技术在葡萄牙语(低资源语言)中的适用性。
  • 通过识别与缓解性别化语言偏见,为开发更公平的葡萄牙语NLP模型做出贡献。

提出的方法

  • 使用包含300维向量与934,966个词汇项的预训练连续词袋(CBOW)word2vec模型进行分析。
  • 采用基于词语类比的性别偏见检测方法,测试关系:'ela'(她) - 'x' ≈ 'y' - 'ele'(他),其中x为职业,y为预期的性别对应词。
  • 通过自定义评估函数计算准确率,检查向量差值最相似的词是否匹配预期的女性职业。
  • 应用几何去偏算法,以中和嵌入空间中的性别方向,方法与英语中的类似。
  • 使用50对男女职业配对列表,在去偏前后评估模型性能。
  • 使用余弦相似度计算向量相似性,并通过gensim库检索最相似的前N个词。

实验结果

研究问题

  • RQ1葡萄牙语词嵌入在多大程度上偏向于性别化职业刻板印象?
  • RQ2应用几何去偏技术后,性别化职业类比的准确率如何变化?
  • RQ3在葡萄牙语词嵌入中,偏见减少与模型性能之间存在何种权衡?
  • RQ4为英语词嵌入开发的技术能否有效适配葡萄牙语?
  • RQ5涉及女性与男性职业的极端类比如何反映语言中的社会性别刻板印象?

主要发现

  • 原始模型在预测正确性别化职业类比上的准确率为18.18%,表明存在可测量但较低的预测性能。
  • 应用去偏方法后,准确率急剧下降至3.03%,表明对模型实用性有显著负面影响。
  • 模型表现出强烈的刻板印象关联,例如'garçonete'(女服务员)被关联到'stripper'(脱衣舞女),而男性对应词则保留在专业语境中。
  • 即使在不合规的案例中,男性职业类比仍保持在专业领域内,而女性类比则频繁转向性化角色。
  • 结果证实,性别偏见在葡萄牙语词嵌入中根深蒂固,尤其体现在与女性专业人士的关联上。
  • 本研究表明,去偏技术可减少偏见,但以牺牲模型准确率为代价,凸显了公平导向NLP中的关键权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。