[논문 리뷰] Prompt Design Matters for Computational Social Science Tasks but in Unpredictable Ways
이 연구는 프롬프트 설계가 계산사회과학 과제에서 대규모 언어모델(LM)의 준수성과 정확도에 미치는 영향을 조사한다. 네 가지 프롬프트 특성—정의 포함 여부, 출력 형식, 설명 요청, 길이—를 세 개의 LLM(챗GPT, PaLM2, Falcon7b)에 대해 네 가지 과제(독성, 감성, 뉴스 루머 태도, 뉴스 프레임)에 적용하여 테스트한다. 결과는 프롬프트 설계가 준수성과 정확도에 예측 불가능하고 과제 및 모델에 따라 다름을 보이며, 수치 평가 시 성능 저하와 설명 요청으로 인한 레이블 분포 변화가 발생함을 시사한다.
Manually annotating data for computational social science tasks can be costly, time-consuming, and emotionally draining. While recent work suggests that LLMs can perform such annotation tasks in zero-shot settings, little is known about how prompt design impacts LLMs' compliance and accuracy. We conduct a large-scale multi-prompt experiment to test how model selection (ChatGPT, PaLM2, and Falcon7b) and prompt design features (definition inclusion, output type, explanation, and prompt length) impact the compliance and accuracy of LLM-generated annotations on four CSS tasks (toxicity, sentiment, rumor stance, and news frames). Our results show that LLM compliance and accuracy are highly prompt-dependent. For instance, prompting for numerical scores instead of labels reduces all LLMs' compliance and accuracy. The overall best prompting setup is task-dependent, and minor prompt changes can cause large changes in the distribution of generated labels. By showing that prompt design significantly impacts the quality and distribution of LLM-generated annotations, this work serves as both a warning and practical guide for researchers and practitioners.
연구 동기 및 목표
- 프롬프트 설계 특성이 계산사회과학 애너테이션 과제에서 LLM의 준수성과 정확도에 미치는 영향을 조사하기 위해.
- 다양한 LLM과 과제에서 프롬프트 효과성에 대한 체계적이고 대규모의 실증적 증거 부족 문제를 해결하기 위해.
- 요약형, 정의 포함형, 또는 설명 요청형 프롬프트가 성능을 향상시키거나 악화시키는지 조사하기 위해.
- 미세한 프롬프트 변경으로 인한 일관되지 않은 애너테이션 분포의 위험을 부각하여 사회과학 연구에 대한 편향 가능성을 경고하기 위해.
- 제로샷 애너테이션 과제에서 LLM을 사용하는 연구자들을 위한 근거 기반의 최선의 실천 방안을 제공하기 위해.
제안 방법
- 16개의 프롬프트 변형(2×2×2×2)을 포함한 대규모 완전 요인 실험을 실시하였으며, 정의 포함 여부, 출력 형식(라벨 대 수치), 설명 요청 여부, 프롬프트 길이(기본 대 요약형)의 네 가지 프롬프트 차원을 다룸.
- 이 프롬프트들을 계산사회과학 과제 네 가지—독성, 감성, 뉴스 루머 태도, 뉴스 프레임 탐지—에 대해 세 개의 LLM(챗GPT, PaLM2, Falcon7b)에 적용함.
- 모든 과제-모델-프롬프트 조합에서의 LLM 생성 애너테이션 총 362,928건을 포함한 통합 데이터셋을 활용함.
- 프롬프트 지시사항 준수 여부(준수성)와 인간 애너테이션 기준과의 일치도(정확도)를 측정함.
- 특히 설명 요청 또는 수치 평가가 포함된 경우의 레이블 분포 변화를 분석함.
- 준수성 변동성(예: 패럴렐7b에서 뉴스 루머 태도 과제에서 최대 55%)과 정확도 변동성(예: 챗GPT에서 뉴스 프레임 과제에서 최대 14%)과 같은 정량적 결과 보고함.
실험 결과
연구 질문
- RQ1프롬프트에 정의를 포함시키는 것이 다양한 계산사회과학 과제에서 LLM의 준수성과 정확도에 어떤 영향을 미치는가?
- RQ2라벨 대신 수치 평가를 요청하는 것이 LLM의 준수성과 정확도에 어떤 영향을 미치는가?
- RQ3요약형 프롬프트가 표준 길이 프롬프트에 비해 모델과 과제 전반에서 준수성과 정확도에 어떻게 영향을 미치는가?
- RQ4이해의 근거를 설명하도록 요청하는 것이 레이블 분포와 준수율에 어느 정도 영향을 미치는가?
- RQ5프롬프트 설계 특성의 영향이 다양한 LLM(예: 챗GPT, PaLM2, Falcon7b)과 과제 간에 어떻게 다름을 보이는가?
주요 결과
- 라벨 대신 수치 평가를 요청하는 프롬프트는 모든 LLM과 대부분의 과제에서 준수성과 정확도를 크게 떨어뜨림.
- 정의를 포함시키는 것은 챗GPT의 정확도를 향상시키며 준수성에 영향을 주지 않았지만, PaLM2와 Falcon7b의 준수성을 감소시킴.
- 요약형 프롬프트는 뉴스 루머 태도 과제에서 PaLM2의 비용 효율성을 높였지만, 대부분의 다른 경우에서 성능을 떨어뜨림.
- 설명 요청은 준수성을 높였지만 레이블 분포를 변화시켰으며, 예를 들어 챗GPT는 설명 요청 시 34% 더 많은 콘텐츠를 '중립'으로 분류함.
- 가장 높은 성능을 보인 프롬프트 구성은 과제 및 모델에 따라 매우 의존적이었으며, 미세한 변경만으로도 출력 분포에 큰 변화가 발생함.
- 패럴렐7b에서 뉴스 루머 태도 과제에서 준수성은 최대 55%까지 변동했고, 챗GPT에서 뉴스 프레임 과제에서 정확도는 최대 14%까지 변동하여 프롬프트 효과의 예측 불가능성을 강조함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.