Skip to main content
QUICK REVIEW

[논문 리뷰] Folksonomication: Predicting Tags for Movies from Plot Synopses Using Emotion Flow Encoded Neural Network

Sudipta Kar, Suraj Maharjan|arXiv (Cornell University)|2018. 08. 15.
Generative Adversarial Networks and Image Synthesis참고 문헌 34인용 수 6
한 줄 요약

이 논문은 플롯 개요에서 감정 흐름을 이중 방향 LSTM을 사용해 인코딩함으로써 영화 태그를 예측하는 새로운 신경망 모델을 제안한다. 이는 기존의 기계 학습 시스템에 비해 태그 예측 성능을 크게 향상시키며, 태그 재현율을 약 18% 향상시킨다. 이는 서사 이해를 위한 감정 역학의 가치를 입증한다.

ABSTRACT

Folksonomy of movies covers a wide range of heterogeneous information about movies, like the genre, plot structure, visual experiences, soundtracks, metadata, and emotional experiences from watching a movie. Being able to automatically generate or predict tags for movies can help recommendation engines improve retrieval of similar movies, and help viewers know what to expect from a movie in advance. In this work, we explore the problem of creating tags for movies from plot synopses. We propose a novel neural network model that merges information from synopses and emotion flows throughout the plots to predict a set of tags for movies. We compare our system with multiple baselines and found that the addition of emotion flows boosts the performance of the network by learning ~18\% more tags than a traditional machine learning system.

연구 동기 및 목표

  • 저명도가 낮은 영화에 대한 사용자 생성 태그의 부족 문제를 해결하기 위해 플롯 요약에서 태그를 자동으로 예측하는 것.
  • 감정적 및 서사적 특성을 반영한 정확한 다차원 태그를 생성하여 영화 추천 및 콘텐츠 탐색을 향상시키는 것.
  • 플롯 전반에 걸친 감정 흐름을 모델링하면 정적 텍스트 특성만을 사용할 때보다 태그 예측 성능이 향상되는지 조사하는 것.
  • 다양한 영화 장르와 태그 유형에 일반화할 수 있는 강력한 신경망 시스템을 개발하는 것.

제안 방법

  • 모델은 플롯 요약에서 국소적인 단어 수준의 특징을 추출하기 위해 합성곱 신경망(CNN)을 사용한다.
  • 이중 방향 장기 단기 기억(BiLSTM) 네트워크가 서사적 순서에 따라 감정의 흐름을 인코딩한다.
  • 감정 흐름은 요약의 각 문장 또는 세그먼트에서 계산된 정서 강도 점수에서 유도된다.
  • CNN 및 BiLSTM 표현은 연결되어 피드포워드 레이어를 통해 다중 레이블 태그 세트를 예측한다.
  • 다중 레이블 분류를 위해 시그모이드 활성화 함수를 사용하는 교차 엔트로피 손실을 사용해 엔드 투 엔드로 학습된다.
  • 모델은 14,000편의 영화로 구성된 데이터셋에서 평가되며, 다수의 베이스라인(다수결 및 무작위 예측)과 수작업으로 작성된 언어적 특징을 사용한 시스템과의 성능 비교가 이루어진다.

실험 결과

연구 질문

  • RQ1플롯 요약에서 감정 흐름을 모델링하면 정적 텍스트 특성만을 사용할 때보다 자동 태그 예측 성능이 향상되는가?
  • RQ2감정 역학을 포함할 경우, 특히 정서적 및 주제적 태그의 재현율과 F1 점수에 어떤 영향을 미치는가?
  • RQ3플롯 요약에서의 예측과 전체 영화 스크립트에서의 예측 간 일치 정도는 어느 정도이며, 그 차이를 유도하는 요인은 무엇인가?
  • RQ4희귀하거나 주관적인 태그(예: '알레고리', '뇌washing')는 모델 성능에 어떤 영향을 미치며, 어떤 과제를 야기하는가?

주요 결과

  • 제안된 모델은 수작업으로 작성된 언어적 특징에 의존하는 기존 기계 학습 시스템에 비해 태그 재현율을 약 18% 향상시킨다.
  • 상위 5개 태그를 예측할 때 모델은 마이크로-F1 점수 38.7%를 기록하며, 태그 재현율(TR)은 15.70으로 베이스라인을 크게 앞서며 성능을 냈다.
  • 감정 흐름을 추가함으로써 모델은 '생각을 자극하는', '긴장감 있는', '드라마틱한'과 같은 감정 경험과 관련된 태그를 더 많이 학습할 수 있었다.
  • 플롯 요약과 전체 영화 스크립트 간 예측을 비교한 결과, 40%의 영화에서 상위 다섯 태그 중 최소 80%가 일치하여 높은 일관성을 보였다.
  • 희귀하거나 주관적인 태그(예: '블랙스포로피에이션', '마법적 현실주의')는 모델이 덜 효과적으로 작동하며, 이는 전체 영화의 0.06% 미만에 해당하는 태그로, 낮은 빈도와 관점에 따라 달라지는 태그를 학습하는 데 어려움을 겪는다는 것을 시사한다.
  • 비슷한 마이크로-F1 점수를 기록함에도 불구하고, 스크립트를 사용할 경우 요약을 사용할 경우보다 태그 재현율이 낮았다. 이는 학습/테스트 분포 불일치와 비언어적 스크립트 요소에서 유래한 노이즈 때문일 가능성이 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.