Skip to main content
QUICK REVIEW

[논문 리뷰] JeSemE: A Website for Exploring Diachronic Changes in Word Meaning and Emotion

Johannes Hellrich, Sven Buechel|arXiv (Cornell University)|2018. 07. 11.
Advanced Text Analysis Techniques참고 문헌 25인용 수 6
한 줄 요약

JeSemE는 디지털 인문학 분야의 학자들이 최신 분포어법 및 감정의 다차원 모델인 Valence-Arousal-Dominance(VAD) 모델을 활용해 어휘 의미와 감정의 역사적 변화를 탐색할 수 있도록 돕는 오픈 액세스이자 사용자 친화적인 웹 플랫폼입니다. COHA 및 Google Books를 포함한 다섯 개의 대규모 역사적 어휘자료를 활용하여 시간에 따라 변화하는 단어 임베딩과 감정 점수를 계산함으로써, 기술적 전문 지식이나 로컬 소프트웨어 설치 없이도 의미 및 정서적 변화—예를 들어 'heart'의 비유적에서 해부학적 의미로의 전환—을 상호작용적으로 시각화할 수 있습니다.

ABSTRACT

We here introduce a substantially extended version of JeSemE, an interactive website for visually exploring computationally derived time-variant information on word meanings and lexical emotions assembled from five large diachronic text corpora. JeSemE is designed for scholars in the (digital) humanities as an alternative to consulting manually compiled, printed dictionaries for such information (if available at all). This tool uniquely combines state-of-the-art distributional semantics with a nuanced model of human emotions, two information streams we deem beneficial for a data-driven interpretation of texts in the humanities.

연구 동기 및 목표

  • 인문학 분야에서 수작업으로 제작된 역사 어휘사전의 제한된 가용성과 커버리지 문제를 해결하기 위해.
  • 기술적 배경이 없는 학자들이 의미와 감정의 시간적 변화를 데이터 기반으로 쉽게 탐색할 수 있도록 도와주기 위해.
  • 다차원 감정 모델(VAD)과 역사적 분포어법을 통합하여 역사적 텍스트의 더 정교한 의미 해석을 가능하게 하기 위해.
  • 기존 도구들이 감정 추적을 하지 않거나 현대어에 국한되거나 이진 감성 분석에만 국한되는 한계를 극복하기 위해.
  • 상호작용적이고 어휘자료 기반의 증거를 통해 역사어학 및 문학 연구에서 가설 수립과 검증을 가능하게 하기 위해.

제안 방법

  • 시스템은 COHA, 독일어 및 영어 Google Books N-gram, Deutsches Textarchiv, Royal Society Corpus 등 다섯 개의 대규모 역사적 어휘자료를 사용하며, 이를 10~50년 간격의 시간 단위로 분할합니다.
  • 각 어휘자료 조각은 철자 정규화 및 역사적 철자 인식 기반의 어원화 처리를 거친 후 처리됩니다.
  • SVD-PPMI가 각 시간 단위에 대해 단어 임베딩을 계산하는 데 사용되어 벡터 공간 내 국소적 이웃 분석이 신뢰성 있게 가능해집니다.
  • 감정 점수는 Bradley와 Lang의 VAD 모델에 기반한 시드 감정 어휘사전의 가중 평균을 통해 계산되며, 목표어와 시드어 간 유사도가 감정 평가에 영향을 미칩니다.
  • 단어 벡터, 공출연관 통계, 빈도 및 감정 값은 관계형 데이터베이스에 저장되며, 성능 향상을 위해 가장 유사한 단어들만 캐시됩니다.
  • 플랫폼은 단어 검색 및 의미 유사도 추세, 감정 경로를 시각화할 수 있는 웹 인터페이스를 제공하며, 프로그래밍 방식의 액세스를 위한 REST API도 제공합니다.

실험 결과

연구 질문

  • RQ1디지털 인문학 분야의 학자들은 인쇄된, 시간 제한이 있는 어휘사전에 의존하지 않고 어떻게 어휘 의미와 감정 어조의 역사적 변화를 접근하고 해석할 수 있을까요?
  • RQ2분포어법 모델은 역사적 어휘, 예를 들어 'heart'처럼 비유적 의미에서 실제 의미로의 전환을 탐지하고 시각화할 수 있는 정도는 어느 정도일까요?
  • RQ3의미가 안정적인 어휘, 예를 들어 'woman'의 경우, 다차원 감정 점수(Valence, Arousal, Dominance)는 시간이 지남에 따라 어떻게 변화할까요?
  • RQ4역사적 어휘자료에서 감정 추적을 통해 여성 참정권 운동과 같은 사회정치적 사건과의 상관관계를 드러낼 수 있을까요?
  • RQ5의미 분석 외에 감정 정보를 통합함으로써 의미 변화의 해석 가능성은 어떻게 향상될 수 있을까요?

주요 결과

  • 'heart'라는 단어는 1900년경에 Valence와 Dominance 점수에 상당한 감소를 보이며, 이는 'stroke'와의 의미 유사도 증가와 동시에 겹쳐져 비유적 의미에서 해부학적 의미로의 전환을 시사합니다.
  • 감정 추적 결과, 'woman'은 1920년대에 VAD의 세 가지 차원 모두에서 뚜렷한 증가를 경험했으며, 이는 미국 여성 참정권 운동과 일치합니다.
  • 사전에 계산된 유사도 대신 단어 벡터를 저장하여 데이터베이스 크기를 약 120GB에서 약 40GB로 줄였으며, 이로 인해 실시간 유사도 계산이 가능해지면서도 가장 관련성이 높은 참조 자료만 캐시됩니다.
  • 시드 어휘사전과의 가중 유사도 기반 감정 유도 방법은 이전 연구에서 검증된 바에 따라 역사적 감정 어휘사전 제작의 다른 접근 방식보다 우수한 성능을 보였습니다.
  • JeSemE는 다국어, 다수의 역사 어휘자료를 대상으로 역사적 의미 변화와 다차원 감정 어조 추적을 통합한 최초의 공개 도구입니다.
  • 플랫폼은 기술적 배경이 없는 사용자들이 의미 및 정서적 변화를 상호작용적으로 탐색할 수 있도록 지원하여, 인문학 연구에서 가설 수립과 증거 기반 검증을 모두 가능하게 합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.