Skip to main content
QUICK REVIEW

[논문 리뷰] Authorship Identification in Bengali Literature: a Comparative Analysis

Tanmoy Chakraborty|arXiv (Cornell University)|2012. 08. 30.
Authorship Attribution and Profiling참고 문헌 11인용 수 17
한 줄 요약

이 논문은 문체적 특징과 기계학습을 활용하여 벤골어 문학을 위한 새로운 저자 식별 시스템을 제안하며, SVM가 통계 모델과 다른 분류기들보다 우수한 성능을 보임을 입증한다. 이는 장르나 시기적 단서가 없더라도 일관되게 저자를 구분할 수 있는 핵심 문체적 지표—예를 들어 단어 길이, 关련어 겹침, 어구 빈도 등—를 규명한다.

ABSTRACT

Stylometry is the study of the unique linguistic styles and writing behaviors of individuals. It belongs to the core task of text categorization like authorship identification, plagiarism detection etc. Though reasonable number of studies have been conducted in English language, no major work has been done so far in Bengali. In this work, We will present a demonstration of authorship identification of the documents written in Bengali. We adopt a set of fine-grained stylistic features for the analysis of the text and use them to develop two different models: statistical similarity model consisting of three measures and their combination, and machine learning model with Decision Tree, Neural Network and SVM. Experimental results show that SVM outperforms other state-of-the-art methods after 10-fold cross validations. We also validate the relative importance of each stylistic feature to show that some of them remain consistently significant in every model used in this experiment.

연구 동기 및 목표

  • 벤골어 문학, 즉 자원이 적고 이전에 문체론 연구가 제한적인 저자 기반 기계학습 식별 시스템을 개발하기 위해.
  • 동일한 특징 집합을 바탕으로 통계 유사도 모델(코사인, 카이제곱, 유클리드)과 기계학습 모델(SVM, 의사결정나무, 신경망)을 비교하기 위해.
  • 다양한 모델 간 저자를 구분하는 데 있어 문체적 특징의 상대적 중요도를 규명하고 검증하기 위해.
  • 벤골어 문학 텍스트의 정제된 코퍼스를 분석하여 향후 인도어 문체론 연구를 위한 기준을 설정하기 위해.

제안 방법

  • 품사, 어절 경계, 문장 분할을 추출하기 위해 얕은 파서를 사용해 벤골어 텍스트를 전처리한다.
  • 단어 길이, 구두점 수, 명사/동사 어구 빈도, 관련어 겹침 등을 포함한 11개의 정규화된 문체적 특징을 토큰, 어구, 문맥 수준에서 추출한다.
  • 각 저자별 상위 50개의 고빈도 키워드를 식별하기 위해 TF-IDF를 적용하고, 정지어를 제외하여 저자별 키워드 집합을 구성한다.
  • 제한된 데이터셋 크기로 인한 과적합 방지를 위해 10겹 교차검증을 적용한다.
  • 예측 정확도와 특징 중요도를 비교하기 위해 SVM, 의사결정나무, 신경망 분류기를 사용한다.
  • 특징 하나씩 제거하면서의 영향을 측정하고 특징의 관련성을 평가하기 위해 추론 실험(ablation study)를 수행한다.

실험 결과

연구 질문

  • RQ1장르와 시기적 단서를 통제할 때, 기계학습 모델이 문체적 특징을 활용해 벤골어 문학 텍스트의 저자를 효과적으로 식별할 수 있는가?
  • RQ2벤골어 저자 식별에서 통계 유사도 측정법(코사인, 카이제곱, 유클리드)과 기계학습 모델(SVM, DT, NN) 간의 성능은 어떻게 비교되는가?
  • RQ3벤골어 저자 식별에서 다양한 기계학습 모델 간에 가장 일관되게 중요한 문체적 특징는 무엇인가?
  • RQ4특징 추론 실험은 모델 정확도에 어떤 영향을 미치며, 성능 차이를 이끌어내는 데 가장 기여하는 특징는 무엇인가?
  • RQ5저자 식별 시스템에서 주로 발생하는 오분류의 원인은 무엇이며, 이는 저자별 글쓰기 패턴과 어떻게 관련되어 있는가?

주요 결과

  • SVM는 10겹 교차검증에서 가장 높은 평균 정확도를 기록했으며, 성능의 분산이 상당히 낮아 안정성을 보였다.
  • 모든 모델에서 단어 길이 특징이 가장 중요한 것으로 일관되게 나타났고, 그 다음으로 목표 저자와의 관련어 겹침(KW(R), KW(A), KW(O))과 명사어구 빈도가 뒤이었다.
  • 대화 길이나 알 수 없는 단어 수와 같은 특징들은 SVM에서는 높은 중요도를 보였지만, 의사결정나무나 신경망 모델에서는 덜 영향을 미쳐 모델에 따라 특징의 중요도가 달라지는 것으로 나타났다.
  • 코헨의 카파 분석 결과 의사결정나무와 신경망 간의 모델 간 일치도가 높았지만, 양쪽 모두 SVM보다 정확도가 떨어져 SVM의 뛰어난 분류 능력을 시사한다.
  • 시스템은 저자 R을 과도하게 추정하는 경향을 보였는데, 이는 이 저자의 코퍼스가 훈련 데이터로써 다양성과 체계성이 부족했기 때문일 가능성이 높다.
  • 추론 실험 결과에서 단어 길이나 관련어 겹침과 같은 핵심 특징을 제거할 경우 정확도가 가장 크게 하락했으며, 이는 이 특징들이 저자 식별에 핵심적인 역할을 한다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.