[논문 리뷰] ChatGPT-4 Outperforms Experts and Crowd Workers in Annotating Political Twitter Messages with Zero-Shot Learning
ChatGPT-4은 Twitter 게시자의 정치 파당 소속 분류를 평가했고 정확도와 신뢰성에서 전문가 코더 및 MTurk 크라우드 워커를 능가하며, 편향은 비교적 같거나 낮고 제로샷 학습으로 수행된다.
This paper assesses the accuracy, reliability and bias of the Large Language Model (LLM) ChatGPT-4 on the text analysis task of classifying the political affiliation of a Twitter poster based on the content of a tweet. The LLM is compared to manual annotation by both expert classifiers and crowd workers, generally considered the gold standard for such tasks. We use Twitter messages from United States politicians during the 2020 election, providing a ground truth against which to measure accuracy. The paper finds that ChatGPT-4 has achieves higher accuracy, higher reliability, and equal or lower bias than the human classifiers. The LLM is able to correctly annotate messages that require reasoning on the basis of contextual knowledge, and inferences around the author's intentions - traditionally seen as uniquely human abilities. These findings suggest that LLM will have substantial impact on the use of textual data in the social sciences, by enabling interpretive research at a scale.
연구 동기 및 목표
- Twitter 콘텐츠에서 정치적 소속을 주석 처리하는 ChatGPT-4의 정확도를 평가한다.
- 실제 정치인 트윗을 기준으로 ChatGPT-4의 성능을 전문가 코더 및 MTurk 크라우드 워커와 비교한다.
- ChatGPT-4와 인간 주석자 간의 신뢰도(코더 간 일치도) 및 편향을 평가한다.
- 평가 기준으로 2020년 선거 기간의 미국 상원의원 트윗의 실제 데이터셋을 사용한다.
제안 방법
- 필터링 후(리트윗/답글/URL 없음, 길이 ≥100) 2020년 미국 선거 이전의 상원의원 트윗 중 500개 트윗(250 공화당, 250 민주당)을 사용한다.
- 제로-/ few-shot 프롬프트를 사용하여 API를 통해 각 트윗을 ChatGPT-4로 분류하고 서로 다른 온도에서 여러 차례 실행한다(저온 0.2에서 5회, 고온 1.0에서 5회, 총 5000개 분류).
- ChatGPT-4 결과를 MTurk 크라우드 워커(Master Qualified US workers, 트윗당 10명의 주석자, 제어 질문 포함) 및 두 명의 전문가 분류자와 비교한다.
- 실제 정답 대비 정확도, 코더 간 신뢰도 Krippendorff’s Alpha, 그리고 주석자 전반에 걸친 편향(민주당 대 공화당 방향)을 계산한다.
실험 결과
연구 질문
- RQ1제로샷 학습을 사용하여 트윗 내용에서 정치적 소속을 정확히 추론할 수 있는가?
- RQ2이 작업에서 ChatGPT-4의 정확도는 전문가 코더와 MTurk 크라우드 워커와 어떻게 비교되는가?
- RQ3인간에 비해 ChatGPT-4의 신뢰도(코더 간 합의도)는 얼마나 되는가?
- RQ4민주당 예측 편향 또는 공화당 예측 편향이 있으며, 그룹 간 비교는 어떠한가?
주요 결과
- ChatGPT-4는 전문가 분류자와 MTurk 작업자 모두보다 높은 정확도를 달성한다.
- ChatGPT-4는 인간 코더보다 더 높은 코더 간 신뢰도(Krippendorff’s Alpha)를 보이며, 특히 낮은 온도에서 더 그렇다.
- 모든 응답자 그룹(ChatGPT-4 및 전문가 포함)은 민주당 예측 편향을 보이고, MTurk 워커는 현저히 더 강한 편향을 보인다.
- 저자 의도 추론과 맥락 지식을 요하는 트윗에서도 ChatGPT-4의 성능이 입증된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.