Skip to main content
QUICK REVIEW

[논문 리뷰] Hollywood Identity Bias Dataset: A Context Oriented Bias Analysis of Movie Dialogues

Sandhya Singh, Prapti Roy|arXiv (Cornell University)|2022. 05. 31.
Authorship Attribution and Profiling인용 수 4
한 줄 요약

이 논문은 35편의 할리우드 영화 각본에서 수집한 대화 수준의 새로운 맥락 인식형 데이터셋인 할리우드 정체성 편향 데이터셋(HIBD)을 소개한다. 이 데이터셋은 성별, 인종/민족, 종교, 연령, 직업, 레즈비언/Lesbian, 게이, 비이성애자, 다문화, 기타 등 7개의 정체성 편향 범주에 대해 주석 처리되었으며, 민감도, 감성, 감정, 근거 등도 포함되어 있다. 총 49,117개 문장 중 1,181개(2.5% 비율)가 편향된 것으로 주석 처리되어 있어 전문가가 검증한 맥락 풍부한 주석을 통해 고정밀도 편향 탐지가 가능하며, 스크립트 작성 시 AI 기반 편향 완화를 위한 기초를 마련한다.

ABSTRACT

Movies reflect society and also hold power to transform opinions. Social biases and stereotypes present in movies can cause extensive damage due to their reach. These biases are not always found to be the need of storyline but can creep in as the author's bias. Movie production houses would prefer to ascertain that the bias present in a script is the story's demand. Today, when deep learning models can give human-level accuracy in multiple tasks, having an AI solution to identify the biases present in the script at the writing stage can help them avoid the inconvenience of stalled release, lawsuits, etc. Since AI solutions are data intensive and there exists no domain specific data to address the problem of biases in scripts, we introduce a new dataset of movie scripts that are annotated for identity bias. The dataset contains dialogue turns annotated for (i) bias labels for seven categories, viz., gender, race/ethnicity, religion, age, occupation, LGBTQ, and other, which contains biases like body shaming, personality bias, etc. (ii) labels for sensitivity, stereotype, sentiment, emotion, emotion intensity, (iii) all labels annotated with context awareness, (iv) target groups and reason for bias labels and (v) expert-driven group-validation process for high quality annotations. We also report various baseline performances for bias identification and category detection on our dataset.

연구 동기 및 목표

  • 영화 각본, 특히 대화 수준에서 사회적 편향을 식별하기 위한 도메인 특화의 맥락 인식형 데이터셋이 부족한 문제를 해결하기 위해.
  • 스크립트 개발 단계에서 편향을 조기에 탐지함으로써 영화 제작 시 논란이 되거나 해로운 콘텐츠가 발생할 위험을 줄이기 위해.
  • 생산 이전에 정체성 기반 편향(예: 성별, 인종, 레즈비언/Lesbian, 게이, 비이성애자 등)을 탐지할 수 있는 AI 모델 개발을 지원하기 위해.
  • 편향 존재 여부뿐 아니라 그 성격(명시적/암시적), 대상 집단, 근거까지 포괄하는 고품질 전문가 검증 주석 프레임워크를 제공하기 위해.
  • 다양하고 실제 세계의 데이터를 기반으로 한 풍부한 맥락 정보를 제공함으로써 영화 대화에서의 편향 탐지 및 범주 분류에 대한 벤치마크를 설정하기 위해.

제안 방법

  • 35편의 할리우드 영화 각본에서 유래한 데이터셋은 문장 수준에서 성별, 인종/민족, 종교, 연령, 직업, 레즈비언/Lesbian, 게이, 비이성애자, 기타 등 7개의 정체성 편향 범주에 대해 주석 처리되었다.
  • 각 편향은 명시적 또는 암시적으로 레이블링되었으며, 주석의 맥락 인식성과 해석 가능성 확보를 위해 대상 집단과 편향 주석의 근거가 기록되었다.
  • 각 발언의 맥락적 이해를 풍부하게 하기 위해 민감도, 감성(긍정/부정), 감정, 감정 강도 등 추가 주석이 적용되었다.
  • 전문가와 NLP 전문가가 참여하는 다단계 전문가 기반 검증 절차를 통해 높은 주석 품질과 일관성을 확보하였다.
  • 최신 NLP 아키텍처인 BERT와 RoBERTa를 활용해 주석 데이터에 맞추어 미세조정된 상태에서, 편향 식별 및 범주 탐지용 기준 모델을 훈련시켰다.
  • 편향 탐지 모델의 강력한 평가를 지원하기 위해 클래스 불균형 문제에 주의를 기울여 데이터셋을 정제하였으며, 편향 발생 비율이 2.5%(49,117개 문장 중 1,181개)임을 고려하였다.

실험 결과

연구 질문

  • RQ1할리우드 영화 대화에서 정체성 기반 편향은 얼마나 퍼져 있으며, 그 주요 형태와 범주는 무엇인가?
  • RQ2맥락 인식 주석이 영화 대화에서의 편향 탐지 정확도와 해석 가능성에 얼마나 기여하는가?
  • RQ3명시적 편향과 암시적 편향은 정체성 범주 전반에서 언어적 특징과 대상 집단 표현 방식에서 어떻게 다름이 있는가?
  • RQ4미세조정된 딥 러닝 모델이 이 새로운 데이터셋을 활용해 영화 각본의 정체성 편향을 인간 수준의 성능으로 탐지할 수 있는가?
  • RQ5감성, 감정, 근거를 포함한 다중 레이블 맥락 풍부 주석이 편향 탐지 성능에 어떤 영향을 미치는가?

주요 결과

  • 할리우드 정체성 편향 데이터셋(HIBD)은 35편의 할리우드 영화 각본에서 유래한 49,117개의 대화 문장을 포함하며, 이 중 1,181개(2.5%)가 편향된 것으로 주석 처리되어 있어 편향 탐지에서 데이터 편향 문제의 도전성을 드러낸다.
  • 이 데이터셋은 성별, 인종/민족, 종교, 연령, 직업, 레즈비언/Lesbian, 게이, 비이성애자, 기타 등 7개의 정체성 범주에 걸쳐 편향을 포괄하며, 신체 비하, 성격 편향 등 다양한 형태를 포함한다.
  • 각 편향 주석에는 명시적/암시적 레이블링, 대상 집단 식별, 근거 기록이 포함되어 있어 맥락 인식형이고 해석 가능한 분석이 가능하다.
  • 감성, 감정, 감정 강도 주석을 포함한 다중 작업 학습을 지원하여 맥락 이해의 풍부함이 향상된다.
  • HIBD에 기반한 미세조정된 기준 모델은 편향 탐지 및 범주 분류에서 경쟁적인 성능을 달성하여, 이 데이터셋이 NLP 시스템의 훈련 및 평가에 실용적임을 입증한다.
  • 전문가 검증 주석 프로세스를 통해 고품질의 신뢰할 수 있는 데이터를 확보하여, 향후 영화 텍스트에서의 편향 탐지 연구를 위한 신뢰할 수 있는 벤치마크로 HIBD가 자리매김한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.