Skip to main content
QUICK REVIEW

[論文レビュー] Measuring Trustworthiness or Automating Physiognomy? A Comment on Safra, Chevallier, Grèzes, and Baumard (2020)

Rory W Spanton, Olivia Guest|arXiv (Cornell University)|Feb 17, 2022
Face Recognition and Perception被引用数 5
ひとこと要約

この論文は、Safraら(2020年)が、受動的信頼性と実際の社会的信頼を混同していると批判し、歴史的肖像画の顔貌特徴に基づいて信頼性を評価するための機械学習モデルが、自動化された身体相学(physiognomy)として機能すると主張している。著者らは、このモデルの主張が方法論的に欠陥があり、統計的に弱く、人種的・文化的バイアスを含み、高リスクの文脈に応用された場合に実際の害を及える可能性があると示している。

ABSTRACT

Interpersonal trust - a shared display of confidence and vulnerability toward other individuals - can be seen as instrumental in the development of human societies. Safra, Chevallier, Grèzes, and Baumard (2020) studied the historical progression of interpersonal trust by training a machine learning (ML) algorithm to generate trustworthiness ratings of historical portraits, based on facial features. They reported that trustworthiness ratings of portraits dated between 1500--2000CE increased with time, claiming that this evidenced a broader increase in interpersonal trust coinciding with several metrics of societal progress. We argue that these claims are confounded by several methodological and analytical issues and highlight troubling parallels between Safra et al.'s algorithm and the pseudoscience of physiognomy. We discuss the implications and potential real-world consequences of these issues in further detail.

研究の動機と目的

  • Safra ら(2020年)の主張、すなわち肖像画における信頼性評価の上昇が、人間関係の信頼の真正の歴史的上昇を反映しているという主張に反論すること。
  • モデルのトレーニング、データ選択、統計的分析における方法論的欠陥を暴露すること。
  • アルゴリズム的身體相学の倫理的危険性、特に人種的・文化的バイアスを強化するリスクを強調すること。
  • 研究コミュニティがAIおよびML研究において身體相学的仮定を拒否するよう促すこと。
  • 偏りのある狭いデータセットから広範な社会的結論に一般化するAIの主張に対して、批判的吟味の必要性を強調すること。

提案手法

  • 著者らは、Safra らの機械学習モデルを分析し、顔の動きユニット(facial action units)を用いて肖像画画像から信頼性を予測するものである。
  • 彼らは、モデルの出力が歴史的身體相学の図解と照合され、擬似科学的顔貌ステレオタイプと視覚的・概念的類似性を示している。
  • 彼らは、報告されたp値、効果量、および時間などの共変量の影響を検討することで、モデルの統計的頑健性を評価している。
  • 彼らはトレーニングデータの文化的・人種的代表性を評価し、白人の顔アバターとWEIRD参加者サンプルのみを用いていることに注目している。
  • 彼らは、アルゴリズムと人間の評価との相関(r = .22)を検討し、実世界の顔への一般化が不十分であることを示している。
  • 彼らは、このモデルが人間の知覚バイアスを自動化され、スケーラブルな身体相学の形に体系化していると主張している。

実験結果

リサーチクエスチョン

  • RQ1Safra らのアルゴリズムは、受動的信頼性の測定と実際の社会的信頼の測定のどちらにどれほど近いか。
  • RQ2データ選択および統計的分析における方法論的欠陥が、主張される歴史的傾向の妥当性をどの程度損なっているか。
  • RQ3アルゴリズムは、歴史的身體相学の仮定とリスクをどのようないくつかの形で再現しているか。
  • RQ4顔貌特徴に基づくAIが社会的レベルの行動変化を推定することは、どのような倫理的含みを有するか。
  • RQ5人種的・文化的バイアスを含むアルゴリズムバイアスは、モデルの結論の信頼性と公平性をどの程度損なっているか。

主な発見

  • モデルと人間の信頼性判断との相関は弱く(r = .22)、実際の顔への一般化が不十分であることを示している。
  • 予測された信頼性と民主的価値の間の関連性は、1つのテストセットでは有意ではなく、時間変数を共変量として加えると頑健性を欠いている。
  • アルゴリズムは白人の顔アバターにのみトレーニングされており、予測における人種的バイアスのリスクが高まっている。
  • WEIRD参加者サンプルに依存しているため、文化的な規範が異なる歴史的集団への一般化性が損なわれている。
  • モデルの出力は、歴史的身體相学に非常に類似しており、差別的判断を自動化する可能性があるという深刻な倫理的懸念を喚起している。
  • この論文は、アルゴリズムが中立的なツールではなく、実際の害を及える可能性がある自動化された身體相学であると結論づけている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。