[论文解读] Hollywood Identity Bias Dataset: A Context Oriented Bias Analysis of Movie Dialogues
本文介绍了好莱坞身份偏见数据集(HIBD),这是一个新颖的、上下文感知的、对话级别的数据集,包含35部好莱坞电影剧本,针对七类身份偏见(性别、种族/族裔、宗教、年龄、职业、LGBTQ及其他)进行标注,同时标注了敏感度、情感、情绪及理由。该数据集包含49,117个句子,其中1,181个存在偏见实例(偏见比例为2.5%),通过专家验证的、富含上下文的标注,实现了高精度的偏见检测,为电影剧本中人工智能驱动的偏见缓解奠定了基础。
Movies reflect society and also hold power to transform opinions. Social biases and stereotypes present in movies can cause extensive damage due to their reach. These biases are not always found to be the need of storyline but can creep in as the author's bias. Movie production houses would prefer to ascertain that the bias present in a script is the story's demand. Today, when deep learning models can give human-level accuracy in multiple tasks, having an AI solution to identify the biases present in the script at the writing stage can help them avoid the inconvenience of stalled release, lawsuits, etc. Since AI solutions are data intensive and there exists no domain specific data to address the problem of biases in scripts, we introduce a new dataset of movie scripts that are annotated for identity bias. The dataset contains dialogue turns annotated for (i) bias labels for seven categories, viz., gender, race/ethnicity, religion, age, occupation, LGBTQ, and other, which contains biases like body shaming, personality bias, etc. (ii) labels for sensitivity, stereotype, sentiment, emotion, emotion intensity, (iii) all labels annotated with context awareness, (iv) target groups and reason for bias labels and (v) expert-driven group-validation process for high quality annotations. We also report various baseline performances for bias identification and category detection on our dataset.
研究动机与目标
- 为解决电影剧本中社会偏见识别,特别是对话层面的领域特定、上下文感知数据集的缺乏问题。
- 通过在剧本创作阶段早期检测偏见,降低电影中出现争议或有害内容的风险。
- 支持开发能够提前识别基于身份的偏见(如性别、种族、LGBTQ)的AI模型,减少法律和声誉风险。
- 提供高质量、专家验证的标注框架,不仅捕捉偏见的存在,还涵盖其性质(显性/隐性)、目标群体及理由。
- 利用多样化、真实世界的数据集,建立电影对白中偏见检测与类别分类的基准。
提出的方法
- 该数据集基于35部好莱坞电影剧本构建,对对话片段在句子级别进行标注,涵盖七类身份偏见类别:性别、种族/族裔、宗教、年龄、职业、LGBTQ及其他。
- 每类偏见均标注为显性或隐性,同时记录目标群体及偏见标注的理由,以确保上下文感知与可解释性。
- 额外标注了敏感度、情感(正面/负面)、情绪及情绪强度,以增强对每个话语上下文的理解。
- 采用多阶段专家驱动的验证流程,由领域专家与NLP专家共同参与,确保标注质量与一致性。
- 基于该数据集,使用最先进的NLP架构(包括BERT和RoBERTa)对基线模型进行微调,以实现偏见识别与类别检测。
- 在数据集构建过程中关注类别不平衡问题,承认2.5%的偏见出现率(49,117个句子中有1,181个存在偏见),以支持对偏见检测模型的稳健评估。
实验结果
研究问题
- RQ1好莱坞电影对白中身份偏见的普遍程度如何?其最常见的形式与类别是什么?
- RQ2上下文感知标注在多大程度上能提升电影对白中偏见检测的准确率与可解释性?
- RQ3显性和隐性偏见在语言标记与身份类别中目标群体的呈现方式上存在哪些差异?
- RQ4微调后的深度学习模型能否在使用该新数据集时实现人类水平的电影剧本身份偏见检测性能?
- RQ5多标签、富含上下文的标注(包括情感、情绪及理由)对偏见检测性能有何影响?
主要发现
- 好莱坞身份偏见数据集(HIBD)包含来自35部好莱坞电影剧本的49,117个对白句子,其中1,181个实例(2.5%)被标注为存在偏见,凸显了在偏见检测中数据偏斜的挑战。
- 该数据集涵盖了七类身份类别——性别、种族/族裔、宗教、年龄、职业、LGBTQ及其他——涵盖身体羞辱和人格偏见等形式。
- 每个偏见标注均包含显性/隐性标签、目标群体识别及理由,支持上下文感知与可解释性分析。
- 该数据集支持多任务学习,包含情感、情绪及情绪强度的标注,增强了上下文理解的丰富性。
- 在HIBD上微调的基线模型在偏见检测与类别分类任务中表现出具有竞争力的性能,证明了该数据集在训练与评估NLP系统方面的实用性。
- 专家验证的标注流程确保了高质量、可靠的数据,使HIBD成为未来电影文本偏见检测研究的可靠基准。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。