[논문 리뷰] MBIC -- A Media Bias Annotation Dataset Including Annotator Characteristics
MBIC는 어휘 수준 및 문장 수준의 편향 언어에 대한 주석과 정치적 성향 및 미디어 소비 습관과 같은 상세한 주석자 특성까지 포함하는 최초의 미디어 편향 데이터셋을 소개한다. 고유의 주석 플랫폼을 통해 각각 10명의 다양한 주석자가 참여한 1,700개의 문장을 수집함으로써, 다양한 배경을 가진 주석자들 간의 미디어 편향 인식에 대한 더 신뢰성 있고 맥락 인식이 가능한 분석이 가능해졌다.
Many people consider news articles to be a reliable source of information on current events. However, due to the range of factors influencing news agencies, such coverage may not always be impartial. Media bias, or slanted news coverage, can have a substantial impact on public perception of events, and, accordingly, can potentially alter the beliefs and views of the public. The main data gap in current research on media bias detection is a robust, representative, and diverse dataset containing annotations of biased words and sentences. In particular, existing datasets do not control for the individual background of annotators, which may affect their assessment and, thus, represents critical information for contextualizing their annotations. In this poster, we present a matrix-based methodology to crowdsource such data using a self-developed annotation platform. We also present MBIC (Media Bias Including Characteristics) - the first sample of 1,700 statements representing various media bias instances. The statements were reviewed by ten annotators each and contain labels for media bias identification both on the word and sentence level. MBIC is the first available dataset about media bias reporting detailed information on annotator characteristics and their individual background. The current dataset already significantly extends existing data in this domain providing unique and more reliable insights into the perception of bias. In future, we will further extend it both with respect to the number of articles and annotators per article.
연구 동기 및 목표
- 자연어처리(NLP) 분야에서 미디어 편향 탐지를 위한 강력하고 대표성 있으며 다양한 데이터셋의 부족을 해결하기 위해.
- 기존 데이터셋의 한계를 극복하고, 편향 인식에 영향을 미치는 주석자 배경 요인을 통합함으로써.
- 고품질의 미디어 편향 레이블을 수집하기 위한 확장 가능한 행렬 기반 주석 방법론을 개발하기 위해.
- 더 신뢰성 있고 맥락 인식이 가능한 미디어 편향 분석을 가능하게 하기 위해 공개된 데이터셋을 구축하기 위해.
- 향후 더 많은 기사와 기사당 주석자 수를 포함해 확장 가능한 기반을 마련하기 위해.
제안 방법
- 행렬 기반의 커뮤니티 기반 주석을 지원하기 위해 자체 개발한 주석 플랫폼을 구축하였다.
- 다양한 미디어 편향 사례를 반영하기 위해 뉴스 기사에서 문장을 선별하였다.
- 각 문장은 어휘 수준 및 문장 수준에서 편향 여부를 10명의 다른 주석자들이 주석 처리하였다.
- 주석자들은 편향된 어휘 및 어구에 대한 레이블을 제공하였으며, 동시에 전체 문장 수준의 편향 평가도 수행하였다.
- 정치적 성향, 미디어 소비 습관, 인구통계학적 데이터 등 주석자 특성 정보를 주석과 함께 수집하였다.
- 개인의 주석자 배경이 편향 레이블링 결정에 어떻게 영향을 미치는지 분석할 수 있도록 데이터셋을 구조화하였다.
실험 결과
연구 질문
- RQ1정치적 성향과 같은 주석자 특성이 뉴스 콘텐츠 내 편향 식별에 어떻게 영향을 미치는가?
- RQ2다양한 미디어 맥락에서 개인 주석자들이 편향 언어에 대해 얼마나 다른 인식을 보이는가?
- RQ3주석자 배경 데이터를 통합함으로써 편향 탐지 모델의 신뢰성과 해석 가능성은 얼마나 향상되는가?
- RQ4현재의 문장 및 주석자 샘플은 실제 세계의 미디어 편향 다양성을 얼마나 잘 대표하고 있는가?
- RQ5다중 주석자 레이블링이 편향 주석의 일관성과 타당성에 어떤 영향을 미치는가?
주요 결과
- MBIC는 정치적 성향 및 미디어 소비 습관과 같은 상세한 주석자 특성까지 포함하는 최초의 데이터셋이다.
- 1,700개의 문장이 각각 10명의 다른 주석자들에 의해 주석 처리되어, 높은 주석자 간 커버리지와 다양성을 확보하였다.
- 주석자 배경 요소가 편향 레이블링에 유의미한 영향을 미치는 것으로 나타나, 주석의 맥락화가 중요하다는 점을 시사하였다.
- 행렬 기반 주석 접근 방식을 통해 주석자 간 변동성을 통제하면서도 효율적이고 확장 가능한 데이터 수집이 가능했다.
- 이 데이터셋은 향후 편향 인식, 모델의 해석 가능성, NLP 시스템의 공정성 연구에 기초 자료를 제공한다.
- 저자들은 향후 연구에서 기사 수와 주석자 다양성 측면에서 데이터셋을 확장할 계획이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.