Skip to main content
QUICK REVIEW

[論文レビュー] Learning via social awareness: Improving a deep generative sketching model with facial feedback

Natasha Jaques, Jennifer McCleary|arXiv (Cornell University)|Feb 13, 2018
Face recognition and analysis参考文献 9被引用数 8
ひとこと要約

本論文は、人間の顔の表情から得られる暗黙の社会的フィードバックを用いて、深層生成スケッチモデルの訓練を行うことを提案している。陽性の感情反応を最適化するための潜在制約GAN(LC-GAN)を採用することで、顔の表情分析と人間の好み評価の両方で、元のSketch RNNよりもはるかに洗練された美しさと感情的な魅力を持つ描画を生成する。

ABSTRACT

In the quest towards general artificial intelligence (AI), researchers have explored developing loss functions that act as intrinsic motivators in the absence of external rewards. This paper argues that such research has overlooked an important and useful intrinsic motivator: social interaction. We posit that making an AI agent aware of implicit social feedback from humans can allow for faster learning of more generalizable and useful representations, and could potentially impact AI safety. We collect social feedback in the form of facial expression reactions to samples from Sketch RNN, an LSTM-based variational autoencoder (VAE) designed to produce sketch drawings. We use a Latent Constraints GAN (LC-GAN) to learn from the facial feedback of a small group of viewers, by optimizing the model to produce sketches that it predicts will lead to more positive facial expressions. We show in multiple independent evaluations that the model trained with facial feedback produced sketches that are more highly rated, and induce significantly more positive facial expressions. Thus, we establish that implicit social feedback can improve the output of a deep learning model.

研究の動機と目的

  • 人間の顔の表情から得られる暗黙の社会的フィードバックが、生成AIモデルの改善に内在的動機付けとして機能するかどうかを調査すること。
  • 現在の深層学習モデルが明示的監視を必要としているという制限を克服し、社会的フィードバックを暗黙的かつリアルタイムの報酬として導入すること。
  • 社会的認識が、生成モデルにおけるより汎用的かつ人間と整合した表現を生み出すかどうかを検討すること。
  • 顔の表情フィードバックが、VAEベースのスケッチ生成器がより好まれる・感情的に惹きつける出力を生成するのを効果的に導けるかどうかを評価すること。

提案手法

  • 本研究では、混合密度ネットワーク出力を持つLSTMベースの変分オートエンコーダーとしてのSketch RNNを用い、スケッチ図を生成する。
  • 顔の表情検出システムが、視聴者のリアルタイム反応(楽しさ、満足、悲しみ、集中)を、生成されたスケッチに対して捉える。
  • 潜在制約GAN(LC-GAN)を訓練し、予測された肯定的顔の表情を最大化し、否定的ものを最小化するVAEの潜在ベクトルを生成する。
  • LC-GANは、顔の反応を報酬信号として用い、VAEの潜在空間を最適化し、より好ましい感情的反応を引き起こすスケッチを生成する。
  • 二重盲検設定で、LC-GANと元のSketch RNNの出力を比較評価し、顔の表情指標と人間の好み評価の両方を用いる。
  • 訓練プロセスでは、顔のフィードバックデータを少量(1クラスあたり63〜69サンプル)のみ使用しており、データの効率性が示された。

実験結果

リサーチクエスチョン

  • RQ1顔の表情という形での暗黙の社会的フィードバックは、生成AI出力の質を向上させる信頼性があり効果的な信号として機能するか?
  • RQ2人間の顔の表情反応を最適化するように深層生成モデルを訓練することで、より好まれやすく感情的に惹きつけるスケッチが得られるか?
  • RQ3社会的フィードバックは、生成モデルの学習において、明示的ラベル付けや報酬形状の必要性をどの程度低減できるか?
  • RQ4社会的フィードバックの統合は、異なるスケッチクラスにわたる生成スケッチの一般化性と現実性にどのような影響を与えるか?

主な発見

  • LC-GANモデルは、元のSketch RNNよりも顕著に肯定的な顔の表情を引き起こし、平均的な楽しさが有意に増加した(t(535) = 2.31, p < .05)。
  • LC-GANモデルは否定的反応も減少させ、平均的な悲しみが有意に低下した(t(535) = -2.01, p < .05)。
  • 人間の好み評価では、LC-GANが4,613回の比較のうち2,843回で元のSketch RNNを上回り、統計的に有意な差(p < .0001)を示した。
  • LC-GANは、ナマズやカニなど複雑な被写体について、より現実的で美的に洗練されたスケッチを生成するよう学習した。
  • モデルはデータ効率性を示し、1スケッチクラスあたり63〜69サンプルの顔のフィードバックのみで性能向上を達成した。
  • 本研究では、反復的な露出に伴い顔の表情が時間経過とともに変化し、悲しみが増加し、集中が減少する傾向が観察され、フィードバックデータに非定常性が存在することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。