Skip to main content
QUICK REVIEW

[論文レビュー] Estimating the Personality of White-Box Language Models

Saketh Reddy Karra, Son Nguyen|arXiv (Cornell University)|Apr 25, 2022
Mental Health via Writing被引用数 12
ひとこと要約

本稿では、ビッグファイブフレームワークを用いて、白ボックス型言語モデルの性格特性を定量化および変更する手法を提案する。モデルを性格に関するアンケート刺激でプロンプトし、ゼロショット分類により応答を分類することで、著者らは性格プロファイルを推定し、微調整を通じてこれらの特性が変更可能であることを示したが、意図しない非対象特性の変化も生じることを確認した。

ABSTRACT

Technology for open-ended language generation, a key application of artificial intelligence, has advanced to a great extent in recent years. Large-scale language models, which are trained on large corpora of text, are being used in a wide range of applications everywhere, from virtual assistants to conversational bots. While these language models output fluent text, existing research shows that these models can and do capture human biases. Many of these biases, especially those that could potentially cause harm, are being well-investigated. On the other hand, studies that infer and change human personality traits inherited by these models have been scarce or non-existent. Our work seeks to address this gap by exploring the personality traits of several large-scale language models designed for open-ended text generation and the datasets used for training them. We build on the popular Big Five factors and develop robust methods that quantify the personality traits of these models and their underlying datasets. In particular, we trigger the models with a questionnaire designed for personality assessment and subsequently classify the text responses into quantifiable traits using a Zero-shot classifier. Our estimation scheme sheds light on an important anthropomorphic element found in such AI models and can help stakeholders decide how they should be applied as well as how society could perceive them. Additionally, we examined approaches to alter these personalities, adding to our understanding of how AI models can be adapted to specific contexts.

研究の動機と目的

  • 大規模言語モデルおよびそのトレーニングデータセットにおける性格特性を、ビッグファイブフレームワークを用いて実証的に定量化すること。
  • プロンプトベースの生成とゼロショット分類を用いて、言語モデルの性格プロファイルを推定するための堅牢な手法を開発すること。
  • 言語モデルにおける性格特性が、性格アノテート済みデータセットを用いた微調整によって、どのようにして変更可能であるかを調査すること。
  • 微調整が非対象の性格次元に与える意図しないシフトの影響を評価すること。
  • 性格特性をカスタマイズ可能な、より制御可能で倫理的かつユーザーフレンドリーなAIシステムを設計する基盤を提供すること。

提案手法

  • 言語モデルをプロンプトするための標準化されたビッグファイブ性格アンケートを用い、開放的応答を生成する。
  • 事前学習済みのゼロショット分類器を適用し、モデルの応答をビッグファイブ性格次元に自動分類する。
  • モデル生成テキストとトレーニングデータセットの両方を、同じゼロショット分類パイプラインで処理し、性格プロファイルを推定する。
  • 特定の性格次元(例:協調性、外向性)をアノテートしたフィルタリング済みデータセットを用いて、白ボックス型言語モデル(例:GPT-2)を微調整する。
  • 微調整前後における性格スコアの変化を、定量的指標と分布分析を用いて評価する。
  • 微調整におけるラベルフィルタリングのための複数のしきい値を用い、性格変更の感度とロバストネスを評価する。

実験結果

リサーチクエスチョン

  • RQ1言語モデルは、そのトレーニングデータの性格特性をどの程度反映しているか?
  • RQ2生成された応答のゼロショット分類を用いて、言語モデルの性格特性を信頼性高く推定できるか?
  • RQ3性格アノテート済みデータセットを用いた微調整により、モデルの性格に測定可能で標的的な変化が生じるか?
  • RQ4微調整中に非対象の性格次元にどのような意図しない副作用が生じるか?
  • RQ5性格変更は正確に実現可能か、それとも複数の特性に広がるのか?

主な発見

  • フィルタリング済みデータセットを用いた微調整により、GPT-2の協調性、勤勉性、感情安定性、開放性の性格スコアが顕著に変化した(表8参照)。
  • 微調整後、GPT-2の中央値である外向性スコアは、しきい値2.5で2.89に低下し、性格プロファイルに顕著なシフトが生じたことが示された。
  • 性格の変化は限定的ではなかった。協調性や勤勉性といった非対象特性でさえ、1つの特性のみを標的にした場合でも変化が生じた。
  • 微調整済みGPT-2モデルの性格特性の分布(図9参照)は、新たなトレーニングデータコーパスの影響を反映している。
  • 微調整にしきい値を用いたラベルを使用する手法2は、特性ごとに一貫したが一様でない変化を示し、異なるしきい値でスコアが変動した。
  • 有望な結果が得られた一方で、本研究は重要な課題を明らかにした:微調整は複数の性格次元に意図しない変化を引き起こし、正確な制御を制限する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。