Skip to main content
QUICK REVIEW

[논문 리뷰] Learning via social awareness: Improving a deep generative sketching model with facial feedback

Natasha Jaques, Jennifer McCleary|arXiv (Cornell University)|2018. 02. 13.
Face recognition and analysis참고 문헌 9인용 수 8
한 줄 요약

이 논문은 인간의 얼굴 표정에서 유도된 암묵적 사회적 피드백을 사용하여 딥 생성 스케치 모델을 훈련시켜 출력 품질을 향상시키는 것을 제안한다. 긍정적인 정서 반응을 최적화하기 위해 잠재 제약 GAN을 활용함으로써, 원본 Sketch RNN보다 훨씬 더 미적으로 선호되고 정서적으로 매력적인 그림을 생성하는 모델이 되었으며, 이는 얼굴 표정 분석과 인간 선호도 평가를 통해 검증되었다.

ABSTRACT

In the quest towards general artificial intelligence (AI), researchers have explored developing loss functions that act as intrinsic motivators in the absence of external rewards. This paper argues that such research has overlooked an important and useful intrinsic motivator: social interaction. We posit that making an AI agent aware of implicit social feedback from humans can allow for faster learning of more generalizable and useful representations, and could potentially impact AI safety. We collect social feedback in the form of facial expression reactions to samples from Sketch RNN, an LSTM-based variational autoencoder (VAE) designed to produce sketch drawings. We use a Latent Constraints GAN (LC-GAN) to learn from the facial feedback of a small group of viewers, by optimizing the model to produce sketches that it predicts will lead to more positive facial expressions. We show in multiple independent evaluations that the model trained with facial feedback produced sketches that are more highly rated, and induce significantly more positive facial expressions. Thus, we establish that implicit social feedback can improve the output of a deep learning model.

연구 동기 및 목표

  • 암묵적 사회적 피드백(인간의 얼굴 표정)이 생성형 AI 모델 향상의 내재적 동기로 작용할 수 있는지 조사하기 위해.
  • 현재의 딥 러닝 모델이 명시적 감독이 필요로 하는 한계를 해결하기 위해, 사회적 피드백을 암묵적 실시간 보상으로 도입하기 위해.
  • 사회적 인지가 생성형 모델에서 더 일반화 가능하고 인간 중심의 표현을 이끌 수 있는지 탐색하기 위해.
  • 얼굴 표정 피드백이 VAE 기반 스케치 생성기의 더 선호되고 정서적으로 매력적인 출력을 이끌 수 있도록 효과적으로 이끌 수 있는지 평가하기 위해.

제안 방법

  • 스케치를 생성하기 위해 LSTM 기반의 변동성 오토인코더에 혼합 밀도 네트워크 출력을 갖춘 Sketch RNN을 사용한다.
  • 실시간으로 시청자들의 반응(유쾌함, 만족감, 슬픔, 집중)을 측정하기 위해 얼굴 표정 감지 시스템을 구현한다.
  • LC-GAN(Latent Constraints GAN)은 예측된 긍정적인 얼굴 표정을 최대화하고 부정적인 것을 최소화하는 잠재 벡터를 생성하도록 훈련된다.
  • LC-GAN은 얼굴 피드백을 보상 신호로 사용하여 VAE의 잠재 공간을 최적화하여 더 유리한 정서 반응을 유도하는 스케치를 생성하도록 한다.
  • 이중 망각 설정에서 LC-GAN과 원본 Sketch RNN 샘플 간의 얼굴 표정 지표와 인간 선호도 평가를 통해 모델을 평가한다.
  • 훈련 과정에서는 얼굴 피드백 데이터가 소량(각 클래스당 63~69개 샘플)만 포함되어 있어 샘플 효율성이 뛰어나다.

실험 결과

연구 질문

  • RQ1얼굴 표정 형태의 암묵적 사회적 피드백이 생성형 AI 출력 품질 향상에 신뢰성 있고 효과적인 신호로 사용될 수 있는가?
  • RQ2사람의 긍정적 얼굴 반응을 최적화하기 위해 딥 생성 모델을 조정하면 더 선호되고 정서적으로 매력적인 스케치가 만들어지는가?
  • RQ3사회적 피드백은 얼마나 많은 명시적 레이블링이나 보상 형태 조정이 필요한가?
  • RQ4사회적 피드백 통합은 다양한 스케치 클래스에 걸쳐 생성된 스케치의 일반화 능력과 현실성에 어떤 영향을 미치는가?

주요 결과

  • LC-GAN 모델은 원본 Sketch RNN보다 유의미하게 더 긍정적인 얼굴 표정을 유도했으며, 평균 유쾌함 수준이 유의미하게 증가했다(t(535) = 2.31, p < .05).
  • LC-GAN 모델은 부정적 표정도 줄였으며, 평균 슬픔 수준이 유의미하게 감소했다(t(535) = -2.01, p < .05).
  • 인간 선호도 평가에서 LC-GAN은 4,613개 비교 중 2,843개에서 원본 Sketch RNN보다 더 선호되었으며, 통계적으로 유의미한 차이가 있었다(p < .0001).
  • LC-GAN은 복잡한 주제(라임노스, 게 등)에 대해 더 현실적이고 미적으로 매력적인 스케치를 생성하는 데 성공했으며, 이는 이전에 자주 잘못 그려졌던 주제였다.
  • 모델는 샘플 효율성을 보였으며, 각 스케치 클래스당 63~69개의 얼굴 피드백 샘플만으로도 성능 향상을 이뤘다.
  • 연구에서 얼굴 표정이 시간에 따라 변화하는 것을 관찰했으며, 반복 노출 후 슬픔이 증가하고 집중도 감소하는 경향을 보여, 피드백 데이터의 비정상성(non-stationarity)이 존재함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.