[논문 리뷰] Language Models Trained on Media Diets Can Predict Public Opinion
언어 모델이 특정 미디어 다이어트에 맞춰 적응하면 COVID-19 및 소비자 신뢰에 대한 서브인구 조사 응답을 예측할 수 있으며, 상관관계는 r=0.46 내외이고 프롬프트 및 미디어 소스에 관계없이 견고함.
Public opinion reflects and shapes societal behavior, but the traditional survey-based tools to measure it are limited. We introduce a novel approach to probe media diet models -- language models adapted to online news, TV broadcast, or radio show content -- that can emulate the opinions of subpopulations that have consumed a set of media. To validate this method, we use as ground truth the opinions expressed in U.S. nationally representative surveys on COVID-19 and consumer confidence. Our studies indicate that this approach is (1) predictive of human judgements found in survey response distributions and robust to phrasing and channels of media exposure, (2) more accurate at modeling people who follow media more closely, and (3) aligned with literature on which types of opinions are affected by media consumption. Probing language models provides a powerful new method for investigating media effects, has practical applications in supplementing polls and forecasting public opinion, and suggests a need for further study of the surprising fidelity with which neural language models can predict human responses.
연구 동기 및 목표
- 부분집단 미디어 다이어트로 학습된 언어 모델을 사용하여 여론을 예측하는 새로운 방법을 제시한다.
- 미디어 콘텐츠에 대해 미세조정된 모델이 COVID-19 및 소비자 신뢰에 대한 설문 응답 분포를 예측할 수 있음을 보여준다.
- 질문 의역 및 서로 다른 미디어 소스와 주의도 수준에 대한 견고성을 평가한다.
제안 방법
- 특정 소스(온라인 뉴스, TV, 라디오)에서 수집한 미디어 다이어트 데이터세트에 대해 기본 언어 모델(예: BERT)을 미세조정한다.
- 설문 질문에서 파생된 빈칸 채우기 프롬프트로 미디어 다이어트 모델을 탐색하고 목표 단어 확률을 계산한다.
- 동의어를 기준으로 확률을 정규화하고 그룹화하여 미디어 다이어트 점수를 도출한다.
- 미디어 다이어트 점수(및 선택적으로 뉴스에 대한 주의도)를 실제 설문 응답 비율에 매핑하기 위한 회귀를 적합한다.
- 임베딩 공간에서 최근접 이웃 분석을 통해 모델 예측을 학습 데이터에 연계 추적한다.
실험 결과
연구 질문
- RQ1RQ1a: 미디어 다이어트 모델이 설문 응답을 예측하는 능력이 있는가?
- RQ2RQ1b: 사전 학습된 신경 모델이 필요한가, 아니면 더 간단한 모델로 충분한가?
- RQ3RQ1c: 미디어 다이어트를 점수 매기기에 동의어 그룹화가 필요한가?
- RQ4RQ1d: 프롬프트의 의역에 결과가 견고한가?
- RQ5RQ2: 미디어 다이어트 모델은 뉴스에 대한 주의도 수준이나 미디어 소스에 따라 달라지는가?
- RQ6RQ3: 특정 주제나 질문 유형이 미디어 다이어트 모델에 의해 더 강하게 예측되는가?
주요 결과
- 미디어 다이어트 점수는 설문 비율과 상관관계가 있다 (r = 0.458, 95% CI [0.350, 0.553]).
- 미디어 다이어트 점수를 사용하는 회귀분석은 설문 비율을 유의하게 예측한다 (beta = 0.115, 95% CI [0.087, 0.142]).
- 동의어 그룹화는 상관관계를 향상시킨다 (그룹화 시 r = 0.458, 그룹화 없이 r = 0.190).
- 미디어 콘텐츠에 적응한 모델은 기본 BERT를 능가한다 (BERT 단독은 r = 0.274; Media Diet BERT는 r = 0.458).
- 미디어 다이어트 점수와 뉴스에 대한 주의도를 결합하면 예측력이 더 높아진다 (beta = 0.523, CI [0.164, 0.882]; R2 = 0.3327).
- 온라인, TV, 라디오 소스 전반과 서로 다른 프롬프트 및 의역 방법에서도 예측력은 유지된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.