Skip to main content
QUICK REVIEW

[논문 리뷰] Can ChatGPT Reproduce Human-Generated Labels? A Study of Social Computing Tasks

Yiming Zhu, Peixian Zhang|arXiv (Cornell University)|2023. 04. 20.
Topic Modeling인용 수 65
한 줄 요약

ChatGPT는 다섯 개의 사회적 컴퓨팅 작업에서 인간이 생성한 주석을 평균 정확도 0.609로 재현할 수 있지만, 작업 및 레이블에 따라 성능이 크게 달라진다.

ABSTRACT

The release of ChatGPT has uncovered a range of possibilities whereby large language models (LLMs) can substitute human intelligence. In this paper, we seek to understand whether ChatGPT has the potential to reproduce human-generated label annotations in social computing tasks. Such an achievement could significantly reduce the cost and complexity of social computing research. As such, we use ChatGPT to relabel five seminal datasets covering stance detection (2x), sentiment analysis, hate speech, and bot detection. Our results highlight that ChatGPT does have the potential to handle these data annotation tasks, although a number of challenges remain. ChatGPT obtains an average accuracy 0.609. Performance is highest for the sentiment analysis dataset, with ChatGPT correctly annotating 64.9% of tweets. Yet, we show that performance varies substantially across individual labels. We believe this work can open up new lines of analysis and act as a basis for future research into the exploitation of ChatGPT for human annotation tasks.

연구 동기 및 목표

  • ChatGPT가 사회적 컴퓨팅 작업에서 인간이 생성한 주석을 재현할 수 있는지 평가한다.
  • 여러 데이터셋에 걸쳐 ChatGPT가 생성한 라벨을 실제 인간 주석과 비교한다.
  • 데이터 라벨링에 ChatGPT를 사용할 때의 강점과 한계를 파악하기 위해 작업별 및 레이블별 성능을 분석한다.
  • 향후 사람 주석 및 크라우드소싱 맥락에서 LLM의 활용을 안내할 시사점을 제공한다.

제안 방법

  • stance, hate speech, sentiment, bot detection, 그리고 Russo-Ukrainian sentiment를 다루는 다섯 개의 영어-언어 인간 주석 트윗 데이터셋을 선택한다.
  • 주제와 라벨 집합이 주어지면 트윗을 분류하고 설명을 제공하는 프롬프트 템플릿으로 OpenAI GPT-3.5-turbo를 사용하여 트윗에 주석을 달는다.
  • 응답의 첫 문장에서 ChatGPT의 기본 라벨을 추출하고 전체 텍스트를 사용해 설명을 도출한다.
  • 가중 F1-스코어, 정밀도, 재현율을 사용하여 ChatGPT 주석을 인간 ground truth와 비교 평가한다.

실험 결과

연구 질문

  • RQ1다양한 사회적 컴퓨팅 작업에서 ChatGPT가 인간이 주석한 라벨을 재현할 수 있는가?
  • RQ2작업 간 및 개별 라벨 범주 간에 ChatGPT의 성능은 어떻게 달라지는가?
  • RQ3각 라벨별 정밀도와 재현율 측면에서 ChatGPT를 주석 도구로 사용할 때의 강점과 한계는 무엇인가?

주요 결과

  • 다섯 가지 작업에 걸친 평균 ChatGPT 주석 정확도는 0.609(sd 0.032)이다.
  • 감정 분석은 작업 정확도가 0.649로 가장 높고 64.9%의 라벨이 올바르게 분류된다.
  • 혐오 발언 task는 전체 성능이 0.571로 낮고 Hate 라벨에서 정밀도 문제가 특히 나타난다(0.353).
  • 봇 탐지 task는 0.639 정확도를 달성하지만 레이블 간 격차가 크게 나타난다(Human 0.748 F1 vs Bot 0.364 F1).
  • Russo-Ukrainian sentiment는 0.573로 작업 성능이 가장 낮고 Pro-Russia vs Pro-Ukraine 라벨 간 차이가 뚜렷하다(0.733 vs 0.429 F1).
  • 작업 내 개별 라벨에 따라 ChatGPT의 라벨 성능이 크게 달라져 균일한 주석 품질에 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.