[논문 리뷰] In Plain Sight: Media Bias Through the Lens of Factual Reporting
이 논문은 렉서컬 및 정보적 편향을 모두 고려한 300개의 뉴스 기사로 구성된 새로운 데이터셋 BASIL을 소개한다. 이는 정보적 편향—독자의 의견을 암묵적으로 이끌기 위해 사용되는 사실적 내용—이 언론 매체에서 더 흔하다는 것을 입증한다. BASIL에서 BERT를 미세조정한 결과, 정보적 편향 탐지가 여전히 큰 도전 과제임을 보여주며, 전체 기사의 맥락 및 다중 출처 비교를 통한 맥락 모델링의 필요성을 강조한다.
The increasing prevalence of political bias in news media calls for greater public awareness of it, as well as robust methods for its detection. While prior work in NLP has primarily focused on the lexical bias captured by linguistic attributes such as word choice and syntax, other types of bias stem from the actual content selected for inclusion in the text. In this work, we investigate the effects of informational bias: factual content that can nevertheless be deployed to sway reader opinion. We first produce a new dataset, BASIL, of 300 news articles annotated with 1,727 bias spans and find evidence that informational bias appears in news articles more frequently than lexical bias. We further study our annotations to observe how informational bias surfaces in news articles by different media outlets. Lastly, a baseline model for informational bias prediction is presented by fine-tuning BERT on our labeled data, indicating the challenges of the task and future directions.
연구 동기 및 목표
- 뉴스 미디어에서 어휘적 편향을 넘어서 정보적 편향—독자의 의견을 암묵적으로 이끌기 위해 사용되는 사실적 내용—을 조사하기 위해.
- 어휘적 및 정보적 편향 스팸에 대해 세밀하게 애너테이션된 300개의 뉴스 기사로 구성된 새로운 데이터셋 BASIL을 구축하기 위해.
- 세 출처가 동일한 사건을 보도하는 트리플릿 설계(이벤트당 세 출처)를 활용해 정치적 이념이 다른 언론 매체 간의 편향 패턴을 비교하기 위해.
- 규칙 기반 방법과 미세조정된 BERT 모델을 사용해 정보적 편향 탐지의 곤란함을 벤치마킹하기 위해.
- 특히 맥락 및 다중 출처 정보를 활용하는 편향 탐지의 향후 연구 방향을 규명하기 위해.
제안 방법
- 정치적 이념이 다른 100개의 이벤트 트리플릿(이벤트당 세 출처)에서 300개의 뉴스 기사를 애너테이션하여 어휘적 편향 및 정보적 편향 스팸 총 1,727개를 식별하였다.
- 어휘적 편향(어휘 선택, 문법 구조)과 정보적 편향(맥락적 프레임, 선택적 사실 포함)을 구분할 수 있는 다중 레이블 애너테이션 체계를 설계하였다.
- 편향 예측을 위해 문장 수준 분류 및 토큰 수준 시퀀스 태깅 작업을 모두 수행하기 위해 BERT-base(cased)를 사용하여 미세조정하였다.
- 모델 훈련 및 평가를 위해 10겹 교차검증을 적용하였으며, 문장 분류 및 시퀀스 태깅 작업에 대해 별도의 분할을 실시하였다.
- 파이프라인 방식을 적용: 먼저 BERT를 사용해 문장을 편향이 있는지 분류한 후, 해당 문장 내 토큰을 태깅하였다.
- TF-IDF 기반 문장 선택을 베이스라인으로 활용하여 기사의 전체 주제에서 벗어난 내용의 편차를 기반으로 편향이 의심되는 문장을 식별하였다.
실험 결과
연구 질문
- RQ1다양한 언론 매체에서 정보적 편향이 어휘적 편향보다 얼마나 자주 발생하는가?
- RQ2정치적 이념이 다른 언론 매체는 동일한 사건을 보도할 때 정보적 편향을 어떻게 표현하는가?
- RQ3BERT 기반 모델은 어휘적 편향에 비해 정보적 편향을 얼마나 잘 탐지할 수 있으며, 주요 과제는 무엇인가?
- RQ4특히 전체 기사의 맥락 또는 다중 출처 보도와 같은 맥락은 정보적 편향 탐지에 어떤 영향을 미치는가?
- RQ5현재의 규칙 기반 및 신경망 기반 방법은 어떻게 암묵적이고 맥락에 의존하는 편향을 식별하는 데에 한계를 보이는가?
주요 결과
- 모든 세 언론 매체에서 정보적 편향이 어휘적 편향보다 더 흔히 발견되었으며, 뉴스 기사에서 정보적 편향이 더 높은 비율을 차지한다.
- 정보적 편향은 기사 전반에 균일하게 분포해 있는 반면, 어휘적 편향은 주로 기사의 시작부분에 집중되어 있다.
- BERT 미세조정 결과 정보적 편향 탐지의 F1 스코어는 18.71, 어휘적 편향은 25.98로, 정보적 편향 탐지가 훨씬 더 어렵다는 것을 시사한다.
- 정보적 편향 예측에서 가장 성능이 뛰어난 BERT 모델은 정밀도 25.56, 재현율 14.78, F1 스코어 18.71를 기록하였으며, 맥락 모델링에도 불구하고 성능이 제한적임을 보여준다.
- TF-IDF를 활용한 규칙 기반 베이스라인은 저유사도 문장을 식별하는 데 상대적으로 잘 성과를 냈으며, 이는 기사의 핵심 주제에서 벗어난 내용의 편차가 정보적 편향의 강력한 신호임을 시사한다.
- 토큰 수준의 시퀀스 태깅 결과, BERT 모델이 정보적 편향 스팸을 식별하는 데서 어휘적 편향 태깅에 비해 더 낮은 재현율과 F1 스코어를 기록함으로써, 정보적 편향 스팸 식별에 어려움을 겪고 있음을 확인할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.