Skip to main content
QUICK REVIEW

[논문 리뷰] Investigating Bias in LLM-Based Bias Detection: Disparities between LLMs and Human Perception

Luyang Lin, Lingzhi Wang|arXiv (Cornell University)|2024. 03. 22.
Forecasting Techniques and Applications인용 수 20
한 줄 요약

본 논문은 대형 언어 모델(LLMs)의 고유한 편향과 이러한 편향이 미디어 편향 탐지에 미치는 영향을 조사하고, 정치적 편향 예측 및 텍스트 계속, 주제 일관성, 디바이싱 전략, 모델 간 편향 경향을 다룬다.

ABSTRACT

The pervasive spread of misinformation and disinformation in social media underscores the critical importance of detecting media bias. While robust Large Language Models (LLMs) have emerged as foundational tools for bias prediction, concerns about inherent biases within these models persist. In this work, we investigate the presence and nature of bias within LLMs and its consequential impact on media bias detection. Departing from conventional approaches that focus solely on bias detection in media content, we delve into biases within the LLM systems themselves. Through meticulous examination, we probe whether LLMs exhibit biases, particularly in political bias prediction and text continuation tasks. Additionally, we explore bias across diverse topics, aiming to uncover nuanced variations in bias expression within the LLM framework. Importantly, we propose debiasing strategies, including prompt engineering and model fine-tuning. Extensive analysis of bias tendencies across different LLMs sheds light on the broader landscape of bias propagation in language models. This study advances our understanding of LLM bias, offering critical insights into its implications for bias detection tasks and paving the way for more robust and equitable AI systems

연구 동기 및 목표

  • LLMs가 편향 예측과 텍스트 계속에서 정치적 편향을 나타내는지 평가한다.
  • 사전 정의된 주제와 잠재적 주제를 포함한 다양한 주제에서 LLMs의 편향 일관성을 검토한다.
  • 프롬프트 엔지니어링과 모델 미세조정을 통한 디바이싱 제거 전략과 성능에 미치는 영향을 조사한다.
  • 여러 개의 오픈 소스 및 클로즈드 소스 LLMs 간의 편향 경향을 비교하여 편향 행동의 모델 간 차이를 이해한다.

제안 방법

  • 평범한 ChatGPT를 사용하여 FlipBias와 ABP 데이터셋에서 왼쪽-중심-오른쪽-불확실(네 가지 라벨) 태스크로 정치적 성향을 평가한다.
  • 정치 기사에서 발췌한 접두사(prefix)를 사용한 기사 이어쓰기 실험을 수행하고, 임베딩 기반 유사성 및 좌/우 어휘 매칭을 사용해 생성된 접미사를 분석한다.
  • 데이터세트 전반의 주제 수준 편향 경향을 정량화하기 위해 Bias Tendency Index(BTI-1, BTI-2)를 도입한다.
  • 프롬프트 기반 설명, few-shot 프롬프트, 디바이싱 진술(DS) 등 디바이징 접근법을 적용하고, 다양한 라벨 분포(L-FT, LC-FT, LCR-FT)를 이용한 미세조정을 수행한다.
  • 전체 편향 예측 및 주제 수준 편향 분포에 대한 디바이징 효과를 평가하고 BiF1, MaF1, BTI 변화와 같은 지표를 보고한다.
  • 추가 LLM들(LLaMa2, Vicuna, Mistral, GPT-4)에 분석을 확장하여 모델 간 편향 경향을 비교한다.

실험 결과

연구 질문

  • RQ1RQ1: LLMs는 편향 예측과 텍스트 계속 작업에서 정치적 편향을 나타내나요?
  • RQ2RQ2: LLMs는 주제(사전 정의된 것 및 잠재적인 것) 전반에서 일관된 편향을 보이나요?
  • RQ3RQ3: LLMs의 디바이싱을 제거하고 편향 탐지 성능을 더 향상시키려면 어떻게 해야 하나요?
  • RQ4RQ4: 다양한 LLM들이 데이터셋과 주제 전반에서 유사한 편향 경향을 보이나요?

주요 결과

  • LLMs는 FlipBias와 ABP에서 정치적 편향 예측에 좌향적 인지 편향을 보이며, 예측에서 Left-Center 비율이 Right-Center 비율보다 더 높다.
  • LLMs는 오른쪽 경향의 정답 기사를 예측하는 데 왼쪽 경향보다 더 나은 성능을 보이며 비대칭적 편향 경향을 시사한다.
  • 짧은 접두사에서 좌향 경향이 나타나고, 접두사 길이가 증가함에 따라 주제 길이 차이로 인해 우향으로 이동한다.
  • Bias Tendency Index(BTI-1, BTI-2)는 주제 의존적 편향을 드러내며, 대부분의 주제는 좌향 경향을 보이지만 주목할 만한 우향 주제도 있다.
  • 프롬프트 기반 방법(특히 Debiasing Statement)을 통한 디바이징은 주제 수준 BTI에서 편향 정렬을 제로에 가깝게 낮추고, 미세조정은 편향 예측 지표를 개선할 수 있지만 전체 편향성은 증가시킬 수 있다.
  • 다른 LLM들은 다양한 편향 프로필을 보이며, 일부 모델은 더 강한 편향 방향을 보이거나 다른 편향 방향을 보이고, 모델 성능이 편향 강도와 엄격히 상관하지는 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.