Skip to main content
QUICK REVIEW

[論文レビュー] Inferred vs traditional personality assessment: are we predicting the same thing?

Pavel Novikov, Лариса Марарица|arXiv (Cornell University)|Mar 17, 2021
Personality Traits and Psychology参考文献 162被引用数 10
ひとこと要約

本研究は、デジタル痕跡から人格を予測する機械学習モデルが、従来の自己報告式評価と同等の結果をもたらすかどうかを評価する。220編の論文を分析した結果、予測された人格的特徴は自己報告の特徴とやや弱い相関(r ≈ 0.42–0.48)を示し、標準的な心理測定の信頼性に達していない。また、安定性や次元性にも欠けることから、推定された特徴は確立された人格構造と同等ではないことが示された。

ABSTRACT

Machine learning methods are widely used by researchers to predict psychological characteristics from digital records. To find out whether automatic personality estimates retain the properties of the original traits, we reviewed 220 recent articles. First, we put together the predictive quality estimates from a subset of the studies which declare separation of training, validation, and testing phases, which is critical for ensuring the correctness of quality estimates in machine learning. Only 20% of the reviewed papers met this criterion. To compare the reported quality estimates, we converted them to approximate Pearson correlations. The credible upper limits for correlations between predicted and self-reported personality traits vary in a range between 0.42 and 0.48, depending on the specific trait. The achieved values are substantially below the correlations between traits measured with distinct self-report questionnaires. This suggests that we cannot readily interpret personality predictions as estimates of the original traits or expect predicted personality traits to reproduce known relationships with life outcomes regularly. Next, we complement quality estimates evaluation with evidence on psychometric properties of predicted traits. The few existing results suggest that predicted traits are less stable with time and have lower effective dimensionality than self-reported personality. The predictive text-based models perform substantially worse outside their training domains but stay above a random baseline. The evidence on the relationships between predicted traits and external variables is mixed. Predictive features are difficult to use for validation, due to the lack of prior hypotheses. Thus, predicted personality traits fail to retain important properties of the original characteristics. This calls for the cautious use and targeted validation of the predictive models.

研究の動機と目的

  • デジタル痕跡から人格を推定する機械学習モデルが、従来の自己報告式人格評価と同等の結果をもたらすかどうかを検証すること。
  • 推定された人格的特徴の心理測定的品質、すなわち信頼性、安定性、有効次元数を評価すること。
  • 予測された特徴が、人生の結果や外部変数と、既知の関係を維持しているかどうかを評価すること。
  • 特に訓練・検証・テストの分離が不十分であるという方法論的欠陥を特定すること。
  • 心理的研究および応用分野における人格予測モデルの慎重な使用と的確な検証を提言すること。

提案手法

  • デジタル記録からの自動的人格予測に関する最近の220件の研究を体系的レビューした。
  • 有効な性能推定を保証するため、訓練・検証・テストの段階が明確に分離された研究に限定した。
  • 報告された性能指標(例:AUC、F1、R²)を、異なる研究間での比較が可能な近似ピアソン相関に変換した。
  • 利用可能なテスト・リテスト信頼性、時間的安定性、有効次元数に関する証拠を用いて、推定特徴の心理測定的特性を評価した。
  • 外部妥当性を分析するため、予測された特徴と人生の結果や行動変数との関係を検討した。
  • 心理的測定器の妥当性評価フレームワークを用い、推定特徴の質を確立された基準と照らして評価した。

実験結果

リサーチクエスチョン

  • RQ1デジタル痕跡から人格を予測する機械学習モデルが、自己報告の人格的特徴とどの程度相関しているか。
  • RQ2予測された人格的特徴は、従来の自己報告式測定と比較して、十分な信頼性と時間的安定性を示しているか。
  • RQ3推定された特徴は、ビッグファイブモデルと同等の有効次元数と構造的整合性を保っているか。
  • RQ4予測された特徴は、人生の結果や行動パターンといった外部変数と意味的に関連しているか。
  • RQ5特にモデル評価における方法論的欠陥が、現在の人格予測研究への信頼性を損なっているか。

主な発見

  • 予測された特徴と自己報告の特徴との間の信頼できる上限相関は、0.42から0.48の範囲にあり、異なる自己報告式測定間で一般的に見られる0.6–0.9の相関とは著しく低い。
  • レビュー対象の20%の研究でのみ、訓練・検証・テストデータの適切な分離がなされており、報告された性能推定の妥当性に懸念が生じる。
  • 予測された人格的特徴は、自己報告の特徴と比較して、テスト・リテスト信頼性が低く、時間的安定性も低い。
  • 推定された特徴は、従来の人格的構造と比較して有効次元数が低く、構造的整合性の欠落を示唆している。
  • テキストベースのモデルの性能は、訓練ドメイン外では著しく低下するが、依然としてランダムベースラインよりは高い。
  • 予測された特徴と外部変数との関係に関する証拠は一貫性がなく、強くも、再現可能でもないパターンは観察されなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。