[論文レビュー] Identifying and Manipulating the Personality Traits of Language Models
本論文では、'Big Five'人間性フレームワークに基づく心理的尺度による質問紙を用いて、言語モデルの認識される人間性特徴を特定・制御する手法を提案している。自己報告の記述やReddit投稿などの文脈を組み込むことで、BERT や GPT2 といったモデルが特定の人間性特徴を高い予測可能性で再現可能であることを実証しており、期待値と観測値の間で中央値のピアソン相関係数が最大 0.84 に達している。
Psychology research has long explored aspects of human personality such as extroversion, agreeableness and emotional stability. Categorizations like the `Big Five' personality traits are commonly used to assess and diagnose personality types. In this work, we explore the question of whether the perceived personality in language models is exhibited consistently in their language generation. For example, is a language model such as GPT2 likely to respond in a consistent way if asked to go out to a party? We also investigate whether such personality traits can be controlled. We show that when provided different types of contexts (such as personality descriptions, or answers to diagnostic questions about personality traits), language models such as BERT and GPT2 can consistently identify and reflect personality markers in those contexts. This behavior illustrates an ability to be manipulated in a highly predictable way, and frames them as tools for identifying personality traits and controlling personas in applications such as dialog systems. We also contribute a crowd-sourced data-set of personality descriptions of human subjects paired with their `Big Five' personality assessment data, and a data-set of personality descriptions collated from Reddit.
研究の動機と目的
- 言語モデルがその文章生成において一貫性があり識別可能な人間性特徴を示すかどうかを調査すること。
- これらの認識される人間性特徴が、人間性の記述や診断用質問などの文脈的入力によって操作可能かどうかを検討すること。
- 人間の自己報告による人間性記述とBig Fiveスコアを対応させた新しいデータセットと、公開されたReddit投稿から得たデータセットの2つを構築・公開すること。
- 言語モデルがテキスト的記述に基づいて人間の人格特徴を予測できるかどうかを評価し、パーソナライズドAIシステムへの応用可能性を検討すること。
- 人間性特徴の認識におけるジェンダー差異を含むモデル行動の潜在的バイアスを検討し、AIにおける人間性操作の倫理的含みを評価すること。
提案手法
- 『Big Five』人間性フレームワークに基づいた心理的尺度を改変し、生成された応答を通じて言語モデルの認識される特徴を調査する。
- 人間性の記述、アンケート回答、Reddit投稿などの文脈的プロンプトを用いて、モデルの出力を条件づけ、その認識される人間性に影響を与える。
- HuggingFaceのBERTとGPT2を用いて、モデルが出力する応答から人間性特徴スコアを予測するためのロジスティック回帰分類器を訓練した。
- 予測された人間性スコアと期待されたスコアの間のピアソン相関係数を計算し、特徴操作の予測可能性を定量化した。
- Amazon Mechanical Turkを介して、100名の被験者から自己報告の人間性記述とそれに基づくBig Fiveスコアを収集・整備したクラウドソーシングデータセットを構築した。
- 公開されたReddit投稿をスクレイピングし、集約することで、モデルの調査に用いる非公式な人間性記述の第二のデータセットを構築した。
実験結果
リサーチクエスチョン
- RQ1文脈的記述を提示された場合、言語モデルが一貫して特定の人間性特徴を文章生成に反映することができるか?
- RQ2洗練された文脈的入力によって、言語モデルの認識される人間性をどの程度制御できるか?
- RQ3言語モデルが人間ユーザーの自己報告テキスト的記述に基づいて、Big Five人間性特徴を正確に予測できるか?
- RQ4ジェンダーに差がある名前を提示された場合、言語モデルが人間性特徴の認識においてジェンダーバイアスを示すか?
- RQ5事前学習データとモデルアーキテクチャが、言語モデルの認識される人間性の出現と可塑性にどのように影響するか?
主な発見
- BERT や GPT2 といった言語モデルは、文脈を提示された場合、人間性特徴を非常に一貫して反映しており、期待値と観測値の間の中央値ピアソン相関係数がそれぞれ 0.84 および 0.81 に達している。
- 人間の自己報告による人間性記述が提示された場合、言語モデルは対応するBig Fiveスコアを最大 0.48 の相関で予測でき、測定可能な予測能力を示している。
- BERT と GPT2 の両方とも、女性と自己認識する名前に対して、協調性、誠実性、感情の安定性の平均スコアが高かったが、感情の安定性(神経症傾向)については乖離が認められた。
- GPT2 は男性と自己認識する名前に対して、外向性と経験への開放性の平均スコアが高かったが、BERT は有意な差が認められず、モデル固有のジェンダーバイアスパターンが示された。
- Redditベースの記述を文脈として用いることで、認識される人間性特徴の一貫性ある操作が可能であることが実証され、一般公開のテキストを用いたキャラクター制御の可能性が示された。
- 本研究では2つのデータセットを公開した。1つは100名の被験者の自己報告記述とBig Fiveスコアを含み、もう1つは1,000件のRedditベースの人間性記述を含むもので、両方とも研究利用のために公開されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。