Skip to main content
QUICK REVIEW

[論文レビュー] Learning to see people like people

Amanda Song, Linjie Li|arXiv (Cornell University)|May 5, 2017
Evolutionary Psychology and Human Behavior参考文献 14被引用数 5
ひとこと要約

本論文では、10K US Adult Face Database を用いて事前学習されたニューラルネットワークを活用し、信頼性、魅力、親しみやすさなどの顔の特徴に関する人間の主観的判断を予測する深層学習アプローチを提案する。主に VGG-16 の conv5_2 層から抽出した特徴量を主成分分析(PCA)で次元削減し、教師ありリッジ回帰モデルを適用した結果、特に合意が高まる特徴について、人間同士の一致よりも高い相関を示した。

ABSTRACT

Humans make complex inferences on faces, ranging from objective properties (gender, ethnicity, expression, age, identity, etc) to subjective judgments (facial attractiveness, trustworthiness, sociability, friendliness, etc). While the objective aspects of face perception have been extensively studied, relatively fewer computational models have been developed for the social impressions of faces. Bridging this gap, we develop a method to predict human impressions of faces in 40 subjective social dimensions, using deep representations from state-of-the-art neural networks. We find that model performance grows as the human consensus on a face trait increases, and that model predictions outperform human groups in correlation with human averages. This illustrates the learnability of subjective social perception of faces, especially when there is high human consensus. Our system can be used to decide which photographs from a personal collection will make the best impression. The results are significant for the field of social robotics, demonstrating that robots can learn the subjective judgments defining the underlying fabric of human interaction.

研究の動機と目的

  • 顔の主観的社会的認識(信頼性、魅力、親しみやすさなど)をモデル化・予測すること。これらは人間関係において重要だが、コンピュータビジョン分野では未だ十分に調査されていない。
  • 物体認識および顔認識タスクで学習された深層ニューラルネットワークの表現が、顔の特徴に関する微細で合意形成された人間の判断に一般化できるかを調査すること。
  • 40の顔の特徴属性における人間の社会的認識の一貫性を評価し、そのような主観的でグループによる評価データから機械学習モデルがどれほど効果的に学習できるかを検証すること。
  • 特定の社会的特徴を予測する際にニューラルネットワークの内部表現がどのように機能しているかを可視化・解釈することで、モデルの解釈可能性を向上させること。
  • 社会的ロボットやバイアス検出への応用を想定し、深層学習を用いて人間と同等の顔の社会的判断を予測するベンチマークを確立すること。

提案手法

  • 10K US Adult Face Database を用いて、VGG-16 や ResNet などの最先端の事前学習済み畳み込みニューラルネットワーク(CNN)を微調整し、社会的認識予測に特化させる。
  • VGG-16 の conv5_2 層から特徴量を抽出し、次元削減のため主成分分析(PCA)を適用。その後、教師ありリッジ回帰を用いて人間の評価を予測する。
  • 40の社会的属性における予測スコアと平均人間評価との間のピアソン相関係数を用いて、モデルの性能を評価する。
  • 人間の合意度を評価するため、レーティング者を繰り返しランダムに二グループに分割し、評価者間相関を計算することで、人間の一致度のベースラインを確立する。
  • 特定のニューロンの活性化を最大化するように勾配ベースの最適化を実行し、顔の特徴のうちモデルが判断に重視している部分を可視化する。
  • 同じ評価プロトコルを用いて、モデルの性能を人間の評価者間信頼性と比較し、公平な比較を実現する。

実験結果

リサーチクエスチョン

  • RQ1物体認識および顔認識タスクで学習された深層ニューラルネットワーク表現は、顔の特徴に関する人間の主観的判断に一般化できるか?
  • RQ2顔の特徴に関する人間の合意度が高いほど、機械学習モデルのその特徴の予測性能も向上するか?
  • RQ3機械学習モデルが平均人間評価と相関を示す程度は、人間同士の相関度を上回るのか?特に主観的な顔の判断において。
  • RQ4ニューラルネットワークが信頼性や魅力といった異なる社会的特徴を予測するために学習する視覚的パターンや顔の特徴は何か?
  • RQ5生成的可視化技術により、人間の顔の社会的認識の裏にある解釈可能な高次元の顔の手がかりを特定できるか?

主な発見

  • 40の社会的属性すべてにおいて、モデルの平均人間評価との相関が人間同士の一致を上回り、主観的認識の予測において優れた一貫性を示した。
  • モデルの性能は人間の合意度と強く相関していた。信頼性や魅力といった評価者間で合意が高まる特徴ほど、モデルの予測精度も高かった。
  • VGG-16 の conv5_2 層に加え、PCA とリッジ回帰を組み合わせたアプローチが最良の性能を示し、顔の魅力に関する人間評価との相関が 0.75 を記録した。
  • 最も高い相関は「笑顔」(0.82)で観察され、感情表現(例:笑顔)はより一貫して認識されやすく、モデル化しやすいことが裏付けられた。
  • 「社交的」(人間の合意度 0.74)や「内向的」(0.50)といった特徴では顕著な非対称性が観察され、これらが単純な反対語ではないことが示され、社会心理学における仮定に疑問を呈した。
  • 最適化された入力の可視化により、モデルが人間の社会的判断に寄与する顔の主要領域(目、鼻、頬、顔の輪郭)に注目していることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。