Skip to main content
QUICK REVIEW

[논문 리뷰] Investigating Chain-of-thought with ChatGPT for Stance Detection on Social Media

Bowen Zhang, Xianghua Fu|arXiv (Cornell University)|2023. 04. 06.
Misinformation and Its Impacts인용 수 17
한 줄 요약

본 논문은 소셜 미디어에서의 입장 탐지를 위해 ChatGPT(GPT-3.5)와 함께 Chain-of-Thought 프롬프팅을 사용하는 것을 조사하고, CoT가 학습 없이 최첨단 또는 경쟁력 있는 성능을 달성할 수 있을 뿐만 아니라 편향과 프롬프팅 설계 문제를 논의하고 있음을 보여준다.

ABSTRACT

Stance detection predicts attitudes towards targets in texts and has gained attention with the rise of social media. Traditional approaches include conventional machine learning, early deep neural networks, and pre-trained fine-tuning models. However, with the evolution of very large pre-trained language models (VLPLMs) like ChatGPT (GPT-3.5), traditional methods face deployment challenges. The parameter-free Chain-of-Thought (CoT) approach, not requiring backpropagation training, has emerged as a promising alternative. This paper examines CoT's effectiveness in stance detection tasks, demonstrating its superior accuracy and discussing associated challenges.

연구 동기 및 목표

  • 소셜 미디어에서 입장 탐지를 위한 VLPLMs의 배치 문제를 다룸으로써 연구의 동기를 제시한다.
  • 훈련 없이 입장 예측을 위한 매개변수 자유 Chain-of-Thought 프롬 prompting(DQA 및 StSQA)을 ChatGPT(GPT-3.5)로 평가한다.
  • 여러 데이터셋에서 CoT 기반 프롬 prompting을 전통적 방법 및 다른 기준선과 비교한다.
  • CoT 성능에 영향을 주는 한계 및 편향 이슈를 확인한다.

제안 방법

  • 두 가지 CoT 프롬 prompting 전략을 비교한다: 직접 질의응답(DQA)과 단계별 질의응답(StSQA).
  • 제로샷 설정(DQA)과 원샷 프롬프트(StSQA)를 사용하여 ChatGPT(GPT-3.5)로 입장 판단을 이끌어낸다.
  • 추론을 유도하기 위해 QAP(질문-대답 쌍) 및 CoT 설명을 포함한 프롬프트를 구성한다.
  • SemEval-2016, VAST(제로샷), P-Stance 데이터셋에서 매크로-F1 및 Favg 지표로 평가한다.
  • 다양한 입장 탐지 기준선(Bicond, CrossNet, SEKT, MemNet, AOA, TAN, ASGCN, Bert_spc, Bert-GCN, PT-HCL 등)과의 벤치마크를 수행한다.
  • 타깃 편향, QAP의 수와 유형, 입장 작업의 세분성 등 CoT 성능에 영향을 주는 요인을 분석한다.

실험 결과

연구 질문

  • RQ1CoT 프롬프팅이 ChatGPT를 사용하여 훈련 없이 최첨단 또는 경쟁력 있는 입장 탐지 성능을 달성할 수 있는가?
  • RQ2표준 데이터셋에서 제로샷 및 원샷 설정에서 서로 다른 CoT 프롬 prompting 전략(DQA 대 StSQA)의 비교는 어떠한가?
  • RQ3타깃 편향, QAP 선택, 작업의 세분성 등 소셜 미디어에서 CoT 기반 입장 탐지에 어떤 한계와 편향이 작용하는가?

주요 결과

  • ChatGPT를 활용한 CoT 프롬프팅은 다수의 데이터셋에서 훈련 없이 입장 탐지에서 최첨단 또는 유사한 성능을 달성할 수 있다.
  • StSQA는 제로샷에서 강한 성능을 보이며 종종 경쟁적 기준선보다 우수한 zero-shot 성능을 나타낸다.
  • ChatGPT는 특정 주제에서 성능을 저하시킬 수 있는 타깃 편향을 보이며, 프롬프트 설계 및 타깃 선택의 주의가 필요하다.
  • QAP의 수와 유형은 성능에 큰 영향을 미치며, 지나치게 구체적인 프롬프트는 정확도를 감소시키는 경우가 있다.
  • 정밀한 입장 정의(타깃에 대한 여러 시각)는 직접적인 극성 분류에 도전이 되며 추가 연구가 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.