Skip to main content
QUICK REVIEW

[論文レビュー] Measurement in the Age of LLMs: An Application to Ideological Scaling

Sean O’Hagan, Aaron Schein|arXiv (Cornell University)|Dec 14, 2023
Computational and Text Analysis Methods被引用数 5
ひとこと要約

本稿では、従来のデータ制約を回避するために、大規模言語モデル(LLMs)を用いてテキストおよび個人の数値的アイデオロギー得点を直接抽出することを提案する。GPT-3.5-turboにゼロショットの思考の連鎖を用いて得点を割り当てるプロンプトを適用することで、確立されたアイデオロギー尺度手法と高い相関(r = 0.94)を示し、LLMsが自然言語における微細で広がりのあるアイデオロギー的信号を捉える能力を示している。

ABSTRACT

Much of social science is centered around terms like ``ideology'' or ``power'', which generally elude precise definition, and whose contextual meanings are trapped in surrounding language. This paper explores the use of large language models (LLMs) to flexibly navigate the conceptual clutter inherent to social scientific measurement tasks. We rely on LLMs' remarkable linguistic fluency to elicit ideological scales of both legislators and text, which accord closely to established methods and our own judgement. A key aspect of our approach is that we elicit such scores directly, instructing the LLM to furnish numeric scores itself. This approach affords a great deal of flexibility, which we showcase through a variety of different case studies. Our results suggest that LLMs can be used to characterize highly subtle and diffuse manifestations of political ideology in text.

研究の動機と目的

  • 「アイデオロギー」のような正確な定義のない抽象的な社会科学的構概念を、言語的文脈に埋め込まれた形で測定する課題に対処すること。
  • 大規模言語モデル(LLMs)が、事前に定義された操作的定義を必要とせず、協力的で柔軟なツールとして社会科学的測定に用いられるかを検討すること。
  • とくにゼロショットの思考の連鎖を用いた直接的なLLMプロンプティングが、一貫性があり解釈可能なアイデオロギー得点をどのように得られるかを評価すること。
  • DW-NOMINATE、TBIP、CFScoresといった確立された手法と比較して、LLMベースのアイデオロギー的尺度化の相関性と一貫性を評価すること。
  • 初期の二値的判断(アイデオロギー的コンテンツの有無)が、LLMベースの測定タスクにおける性能に良い影響を与えるか、悪影響を与えるかを評価すること。

提案手法

  • GPT-3.5-turboを用いて、テキストや個人に対して連続的スケールの数値的アイデオロギー得点を直接割り当て、LLMを協力的対話相手として扱う。
  • 人間のフィードバックを用いた動的自己アンカー化を実装し、多様な入力タイプにわたるLLMの応答を安定化およびキャリブレーションする。
  • 最終的な数値的得点を割り当てる前に、段階的な推論を誘導するためのゼロショットの思考の連鎖プロンプティングを適用する。
  • 3つのプロンプティング戦略をテストする:(1) すべてのツイートを直接得点化、(2) 二値的判断によりアイデオロギー的とされたツイートのみを得点化、(3) 二値的判断とゼロショットの思考の連鎖を組み合わせる。
  • カーネル密度推定と相関分析を用い、DW-NOMINATE、TBIP、CFScoresから得られた基準アイデオロギー尺度とLLMが得た得点を比較する。
  • 全体および与党グループ(レパブリック党およびデモクラシー党)ごとに性能を評価し、言語的スタイルやアイデオロギー的ニュアンスへの感受性を検証する。
Figure 1 : Kernel density estimates of the distribution of GPT-elicited ideal points for Donald Trump and Bernie Sanders. Two prompts are used: one which leaves open the interpretation of “authoritarian-libertarian”, and one which elaborates informally.
Figure 1 : Kernel density estimates of the distribution of GPT-elicited ideal points for Donald Trump and Bernie Sanders. Two prompts are used: one which leaves open the interpretation of “authoritarian-libertarian”, and one which elaborates informally.

実験結果

リサーチクエスチョン

  • RQ1LLMsは、構造化された行動データに依存せずに、テキストおよび個人の数値的アイデオロギー得点を信頼性高く抽出できるか?
  • RQ2ゼロショットの思考の連鎖推論を組み込むことで、LLMベースのアイデオロギー的尺度化の一貫性と正確性はどのように向上するか?
  • RQ3二値的判断によるアイデオロギー的コンテンツの事前フィルタリングは、LLMベースの測定の性能を向上させるか、それとも悪化させるか?
  • RQ4LLMが得たアイデオロギー的得点は、DW-NOMINATE や TBIP といった確立された基準手法とどの程度相関するか?
  • RQ5LLMsは、特にレパブリック党のツイートのような派閥的文脈において、微細で広がりのあるアイデオロギー的信号をどの程度捉えることができるか?

主な発見

  • ゼロショットの思考の連鎖とアイデオロギー的フィルタリングを組み合わせた最終的なスコアリング手法において、LLMの得点とGPTが得た理想点との間で相関係数r = 0.94を示し、強い内部的一致性を示している。
  • レパブリック党のグループでは、ゼロショットの思考の連鎖を用いない二値的フィルタリングを適用した場合、LLM得点と基準手法との相関が著しく低下し(r = 0.0)、このようなフィルタリングが微細で広がりのあるアイデオロギー的コンテンツの測定に悪影響を及える可能性を示唆している。
  • ゼロショットの思考の連鎖とアイデオロギー的フィルタリングを組み合わせた手法(図7の濃い青色)は、調査された5人の上院議員全般において、GPTが得た理想点の周囲に最も集中し、正確な分布を示した。
  • カーネル密度推定の結果、唯一、ゼロショットの思考の連鎖を用いた高度なプロンプティング戦略が、GPTが得た理想点と一貫して一致する得点分布を生み出し、とくにアイデオロギー的複雑性の高いツイートを持つ上院議員において顕著であった。
  • 結果から、LLMsは、推論に基づくプロンプティングによって誘導されれば、特に明示的に述べられていない文脈においても、テキスト内の微細なアイデオロギー的ニュアンスを効果的に測定できることが示唆される。
  • 本研究は、LLMsが、構造化された行動データ源を必要とせず、アイデオロギーのような構概念の言語的豊かさを保ちながら、スケーラブルで柔軟な社会科学的測定ツールとして機能できることを示している。
Figure 2 : Ideal point scores for members of the $114^{\textrm{th}}$ U.S. Senate. The GPT-elicited scores are depicted as box-plots, which describe variability across variations in prompt (i.e., Senator order). Rows are sorted in in ascending order by the mean of the GPP-elicited scores. We compare
Figure 2 : Ideal point scores for members of the $114^{\textrm{th}}$ U.S. Senate. The GPT-elicited scores are depicted as box-plots, which describe variability across variations in prompt (i.e., Senator order). Rows are sorted in in ascending order by the mean of the GPP-elicited scores. We compare

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。