[논문 리뷰] Measurement in the Age of LLMs: An Application to Ideological Scaling
이 논문은 전통적인 데이터 제약을 우회하기 위해 대규모 언어 모델(Large Language Models, LLMs)을 사용하여 텍스트와 개인의 수치적 이념적 점수를 직접 유도하는 방법을 제안한다. GPT-3.5-turbo를 사용해 제로샷 체인오브thought 추론을 통해 점수를 할당함으로써, 기존의 이념적 척도 방법과 높은 상관관계(r = 0.94)를 보이며, LLM이 자연어 내의 미묘하고 산산이 흩어진 이념적 신호를 포착할 수 있음을 보여준다.
Much of social science is centered around terms like ``ideology'' or ``power'', which generally elude precise definition, and whose contextual meanings are trapped in surrounding language. This paper explores the use of large language models (LLMs) to flexibly navigate the conceptual clutter inherent to social scientific measurement tasks. We rely on LLMs' remarkable linguistic fluency to elicit ideological scales of both legislators and text, which accord closely to established methods and our own judgement. A key aspect of our approach is that we elicit such scores directly, instructing the LLM to furnish numeric scores itself. This approach affords a great deal of flexibility, which we showcase through a variety of different case studies. Our results suggest that LLMs can be used to characterize highly subtle and diffuse manifestations of political ideology in text.
연구 동기 및 목표
- 정의가 명확하지 않고 언어적 맥락에 통합된 추상적인 사회과학 개념(예: '이념')을 측정하는 데 도전하는 것.
- 대규모 언어 모델(LLMs)이 사전 정의된 운영 정의 없이도 협력적이고 유연한 도구로 사회과학 측정에 활용될 수 있는지 탐색하는 것.
- 특히 제로샷 체인오브thought를 활용한 직접적인 LLM 프롬프팅이 일관되고 해석 가능한 이념적 점수를 유도하는 데 얼마나 효과적인지 평가하는 것.
- DW-NOMINATE, TBIP, CFScores와 같은 기존 방법과 비교하여 LLM 기반의 이념적 척도 측정이 상관관계와 일관성 측면에서 얼마나 성과를 내는지 평가하는 것.
- 초기의 양항 판단이 LLM 기반 측정 작업 성능에 미치는 영향(향상 또는 악화)을 평가하는 것.
제안 방법
- LLM을 협력적 대화자로 간주하여, 텍스트나 개인에게 연속 척도상의 수치적 이념적 점수를 직접 할당하도록 GPT-3.5-turbo를 사용하는 것.
- 다양한 입력 유형에 걸쳐 LLM의 응답을 안정화하고 校정하기 위해 인간 피드백을 통한 동적 자기기반 설정을 구현하는 것.
- 최종 수치적 점수를 할당하기 전에 단계별 추론을 유도하기 위해 제로샷 체인오브thought 프롬프팅을 적용하는 것.
- 세 가지 프롬프팅 전략을 테스트하는 것: (1) 직접적으로 모든 트윗에 점수를 할당, (2) 이념적 내용으로 간주되는 트윗만 선별하여 점수 할당, (3) 양항 판단과 제로샷 체인오브thought를 조합하는 것.
- 커널 밀도 추정과 상관계수 분석을 사용하여 LLM이 유도한 점수와 DW-NOMINATE, TBIP, CFScores의 기준 이념 척도 간의 비교를 수행하는 것.
- 전체 및 정당 그룹(공화당 및 민주당) 내에서의 성능 평가를 통해 언어 스타일과 이념적 뉘앙스에 대한 민감도를 평가하는 것.

실험 결과
연구 질문
- RQ1LLMs는 구조화된 행동 데이터에 의존하지 않고도 텍스트와 개인에 대한 수치적 이념적 점수를 신뢰성 있게 유도할 수 있는가?
- RQ2제로샷 체인오브thought 추론을 통합할 경우, LLM 기반의 이념적 척도 측정의 일관성과 정확도는 어떻게 영향을 받는가?
- RQ3이념적 내용에 대한 사전 필터링(양항 판단)이 LLM 기반 측정 성능을 향상시키는가, 아니면 저해하는가?
- RQ4LLM이 유도한 이념적 점수는 DW-NOMINATE나 TBIP와 같은 기존 기준 방법과 얼마나 높은 상관관계를 보이는가?
- RQ5LLMs는 특히 공화당 트윗와 같은 파벌적 맥락에서 정치적 논의 내에서 미묘하고 산만한 이념적 신호를 어느 정도 포착할 수 있는가?
주요 결과
- 제로샷 체인오브thought와 이념적 필터링을 통합한 최종 점수 방법이 GPT가 유도한 이상점수와 상관관계 0.94를 기록하며 강력한 내부 일관성을 보였다.
- 공화당 그룹에서는 제로샷 체인오브thought 없이 양항 필터링만을 사용한 경우 상관관계가 급격히 떨어졌으며(r = 0.0), 이는 이러한 필터링이 미묘하고 산만한 이념적 내용에 대해 성능을 해칠 수 있음을 시사한다.
- 제로샷 체인오브thought와 이념적 필터링을 통합한 방법(그림 7의 어두운 파란색)은 분석한 다섯 명의 sena에 대해 GPT가 유도한 이상점수 주변에 가장 집중되고 정확한 분포를 보였다.
- 커널 밀도 추정 결과, 유일하게 제로샷 CoT를 포함한 가장 정교한 프롬프팅 전략만이 GPT가 유도한 이상점수와 일관되게 일치하는 점수 분포를 생성했으며, 특히 이념적으로 복잡한 트윗을 올린 상원의원의 경우 더욱 두드러졌다.
- 결과적으로 LLM은 추론 기반 프롬프팅에 의해 안내될 경우, 특히 이데올로기가 명시적으로 드러나지 않는 맥락에서도 텍스트 내에서 미묘한 이념적 뉘앙스를 효과적으로 측정할 수 있음을 시사한다.
- 본 연구는 LLM이 사회과학 측정의 확장 가능하고 민감한 도구로 활용될 수 있으며, 이데올로지와 같은 개념의 언어적 풍부성을 유지하면서도, 구조화된 행동 데이터 출처가 필요로 하지 않는다는 점을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.