Skip to main content
QUICK REVIEW

[논문 리뷰] Mining and modeling character networks

Anthony Bonato, David Ryan D’Angelo|arXiv (Cornell University)|2016. 08. 02.
Complex Network Analysis Techniques참고 문헌 21인용 수 5
한 줄 요약

이 논문은 소설과 영화의 캐릭터 네트워크를 모티프 기반 특징과 확률적 네트워크 모델을 사용하여 모델링하고 비교하기 위한 기계학습 프레임워크를 제안한다. 밀도가 높고 이질적인 부분 구조를 띠는 것이 문학적 사회 네트워크에서 흔한 특징이기 때문에 찬-루 모델이 캐릭터 네트워크에 가장 잘 맞는 것으로 나타났다.

ABSTRACT

We investigate social networks of characters found in cultural works such as novels and films. These character networks exhibit many of the properties of complex networks such as skewed degree distribution and community structure, but may be of relatively small order with a high multiplicity of edges. Building on recent work of beveridge, we consider graph extraction, visualization, and network statistics for three novels: Twilight by Stephanie Meyer, Steven King's The Stand, and J.K. Rowling's Harry Potter and the Goblet of Fire. Coupling with 800 character networks from films found in the http://moviegalaxies.com/ database, we compare the data sets to simulations from various stochastic complex networks models including random graphs with given expected degrees (also known as the Chung-Lu model), the configuration model, and the preferential attachment model. Using machine learning techniques based on motif (or small subgraph) counts, we determine that the Chung-Lu model best fits character networks and we conjecture why this may be the case.

연구 동기 및 목표

  • 전통적인 문학적 분석을 넘어서, 소설과 영화와 같은 문화적 작품의 캐릭터 네트워크를 정량적이고 알고리즘적인 방식으로 분석할 수 있는 방법을 개발하기 위해.
  • 표준 확률적 네트워크 모델이 서사 텍스트에서 유도된 캐릭터 네트워크의 구조적 특성을 정확히 재현할 수 있는지 조사하기 위해.
  • 실제 캐릭터 네트워크 데이터와 가장 유사하게 일치하는 네트워크 모델—찬-루, 구성, 선호적 연결, 이항 무작위 그래프—중에서 특정 모델을 결정하기 위해.
  • 모티프 수와 기계학습을 활용해 모델 선택을 가능하게 하고 네트워크 모델의 정확성에 대한 실증적 검증을 제공하기 위해.
  • 모델 적합도가 서사 구조와 허구의 사회 체계를 구성하는 작가의 의도적 설계 방식에 미치는 함의를 탐색하기 위해.

제안 방법

  • 슬라이딩 윈도우 내에서 캐릭터 이름의 공존을 기반으로, 세 편의 소설(타이타닉, 더 스탠드, 해리 포터와 화염의 피 скор)과 800개의 영화 네트워크에서 가중치가 부여된 캐릭터 네트워크를 추출하였다.
  • 핵심 캐릭터와 커뮤니티 구조를 파악하기 위해 표준 네트워크 통계(지름, 클러스터링 계수, 페이지랭크 및 베타윈스 중심성 등 중심성 측정치)를 계산하였다.
  • 실제 네트워크의 노드 수와 평균 차수를 고려해, 찬-루, 구성, 선호적 연결, 이항 무작위 그래프의 네 가지 확률적 네트워크 모델을 시뮬레이션하였다.
  • 기계학습 분류기의 특징으로서 모티프(작은 부분 그래프) 수를 사용하였으며, ℓ1 및 ℓ2 정규화를 적용한 서포트 벡터 머신(SVM), 랜덤 포레스트, 어드라보스트를 포함하였다.
  • 모델 간의 구분력을 향상시키기 위해 고유값 히스토GRAM과 그래프 프로파일(3-노드 및 4-노드 비동형 부분 그래프)을 추가 특징으로 적용하였다.
  • 감독 학습을 통해 모델 선택을 수행하였으며, 훈련된 분류기를 사용해 각 실세계 캐릭터 네트워크와 가장 잘 맞는 모델을 예측하였다.

실험 결과

연구 질문

  • RQ1어느 확률적 네트워크 모델이 문학적 작품에서 유도된 캐릭터 네트워크의 구조적 특징을 가장 정확하게 재현하는가?
  • RQ2캐릭터 네트워크의 맥락에서, 모티프 수와 부분 그래프 프로파일은 서로 다른 네트워크 모델을 구분하는 데 어떻게 비교될 수 있는가?
  • RQ3작은 크기이면서도 높은 간선 다중성(edge multiplicity)을 보이는 캐릭터 네트워크임에도 불구하고 찬-루 모델이 다른 모델보다 우수한 성능을 보이는 이유는 무엇인가?
  • RQ4네트워크 모티프 기반 기계학습 기법을 통해 허구의 사회 네트워크 배경이 되는 생성 과정을 신뢰성 있게 식별할 수 있는가?
  • RQ5모델 적합도는 서사 구성 과정에 대해 어떤 함의를 갖는가? 예를 들어, 작가들이 연결을 구축하기 전에 노드의 차수를 암묵적으로 정의하는가?

주요 결과

  • 찬-루 모델은 세 편의 소설과 800개의 영화 네트워크 전반에서 일관되게 가장 적합한 모델로 선정되었으며, SVM 및 기타 분류기들이 모델 간 명확한 분리 구조를 보였다.
  • 해리 포터 네트워크의 경우, SVM-ℓ2 모델이 찬-루 모델에 대해 4.44의 점수를 기록하여 구성 모델(−1.15)과 선호적 연결 모델(−10.64)을 크게 앞섰다.
  • 랜덤 포레스트 모델은 해리 포터 데이터셋에서 찬-루 모델을 다른 모델들과 분별하는 데 99.8%의 정확도를 달성하여 강력하고 일관된 모델 간 분리가 이루어졌음을 시사했다.
  • 어드라보스트는 타이타닉 네트워크에서 찬-루 모델에 대해 47.4의 점수를 기록했으며, 다음으로 높은 점수를 기록한 선호적 연결 모델(34.51)보다 훨씬 높았다.
  • 찬-루 모델의 성공은 캐릭터 네트워크의 커뮤니티 중심적이고 계층적인 특성과 일치하는 다양한 밀도가 높은 부분 구조를 생성할 수 있다는 점에 기인한다.
  • 본 연구는 캐릭터 네트워크가 크기가 작더라도 비트리비얼한 구조를 보이며, 선호적 연결이나 기하학적 모델이 아닌 차수 조건 기반 무작위 그래프 모델(예: 찬-루 모델)을 통해 효과적으로 모델링할 수 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.