Skip to main content
QUICK REVIEW

[論文レビュー] CommunityLM: Probing Partisan Worldviews from Language Models

Hang Jiang, Doug Beeferman|arXiv (Cornell University)|Sep 15, 2022
Topic Modeling被引用数 9
ひとこと要約

本稿では、2020年ANES調査期間以前に収集された、自らを民主党・共和党と特定するTwitterユーザーの投稿データを用いて、GPT-2言語モデルをファインチューニングするフレームワークであるCommunityLMを紹介する。この手法は、ANES調査の質問をプロンプトとして用いることで、民主党・共和党コミュニティ固有の反応を生成し、実際の派閥的立場を予測する際、ベースラインを著しく上回る性能を示しており、実際の調査データと強い整合性を示している。

ABSTRACT

As political attitudes have diverged ideologically in the United States, political speech has diverged lingusitically. The ever-widening polarization between the US political parties is accelerated by an erosion of mutual understanding between them. We aim to make these communities more comprehensible to each other with a framework that probes community-specific responses to the same survey questions using community language models CommunityLM. In our framework we identify committed partisan members for each community on Twitter and fine-tune LMs on the tweets authored by them. We then assess the worldviews of the two groups using prompt-based probing of their corresponding LMs, with prompts that elicit opinions about public figures and groups surveyed by the American National Election Studies (ANES) 2020 Exploratory Testing Survey. We compare the responses generated by the LMs to the ANES survey results, and find a level of alignment that greatly exceeds several baseline methods. Our work aims to show that we can use community LMs to query the worldview of any group of people given a sufficiently large sample of their social media discussions or media diet.

研究の動機と目的

  • 公開ディスコースでトレーニングされた言語モデルを用いて、コミュニティ固有の世界観をスケーラブルかつ柔軟に探査するフレームワークの開発。
  • ファインチューニングされた言語モデルが、有名人や社会的グループに対するコミュニティの派閥的態度を正確に反映できるかどうかの調査。
  • CommunityLMの性能を、事前学習済みモデルやキーワード検索ベースラインと比較し、派閥的立場の予測性能を評価すること。
  • モデルの誤りを分析し、有名人の順位付けに際して生成された反応の信頼性を評価すること。
  • 合成的に生成された意見を通じて、ユーザーが反対立場のコミュニティの視点を探索できるようにし、建設的対話を促進すること。

提案手法

  • 2020年ANES調査期間以前に収集された、自らを民主党・共和党と特定するTwitterユーザーの投稿データをそれぞれ470万件使用し、GPT-2言語モデルをファインチューニングする。
  • ANES 2020エクスプロラトリー・テスト調査の質問をプロンプトとして用い、4種類の異なるプロンプト形式(例:「Xは~である」)を用いて、意見に似た反応を誘発する。
  • 生成された反応に基づき、16名の有名人の平均的立場スコアを算出し、各コミュニティ内での評価の好ましさを順位付けする。
  • 予測性能を評価するため、生成された反応と実際のANES調査結果の間の相関係数および正答率を用いて比較する。
  • 誤り分析として、生成された出力と真のANES回答を比較し、体系的な欠落や誤分類を特定する。
  • 個々のサンプルに依存するのではなく、生成出力全体の統計的パターンを用いることで、頑健性を確保し、幻覚のリスクを低減する。

実験結果

リサーチクエスチョン

  • RQ1ファインチューニングされたGPT-2モデルが、有名人に関するコミュニティの実際の派閥的立場を反映する反応を生成できるか?
  • RQ2CommunityLMの性能は、事前学習済みモデル(例:GPT-3 Curie)およびキーワードベースのベースラインと比較して、どのように異なるか?
  • RQ3どのプロンプト形式が、コミュニティの立場を最も正確かつ信頼性高く予測できるか?
  • RQ4CommunityLMが行う体系的な誤りは何か。それらは特定の有名人や社会的グループとどのように関連しているか?
  • RQ5CommunityLMは、各政治的コミュニティ内での有名人の評価の好ましさをどの程度正確に順位付けできるか?

主な発見

  • 「Xは~である」プロンプトを用いたファインチューニング済みCommunityLMが、事前学習済みGPT-3 Curieおよびキーワード検索ベースラインを著しく上回る正答率を達成した。
  • CommunityLMが生成した反応は、実際のANES調査結果と強く整合しており、特にドクター・ファウチや政治的グループに対する派閥的差を的確に捉えていた。
  • 共和党用GPT-2モデルは、ドクター・ファウチに対して「嘘つき」「冗談」を上位に挙げたが、民主党用モデルは「ヒーロー」「真実」を上位に挙げており、実際の派閥的対立を反映していた。
  • 誤り分析の結果、キーワード検索ベースラインは「密入国者」や「大企業」などのキーワードを欠落していたのに対し、ファインチューニング済みCommunityLMは「白人」や「ドクター・アントニ・ファウチ」を欠落させていた。
  • CommunityLMの立場スコアを用いた有名人の順位付けにより、共和党モデルは民主党政治家をより否定的に評価し、逆に民主党モデルは共和党政治家を否定的に評価していた。アンドリュー・ヤンは両コミュニティから高い評価を得ていた。
  • 本研究は、直接のインタビューを経由せずに、生成された反応の統計的パターンを用いることで、コミュニティレベルの好みや世界観の違いを信頼性高く抽出できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。