Skip to main content
QUICK REVIEW

[논문 리뷰] Authorship Attribution Using Word Network Features

Shibamouli Lahiri, Rada Mihalcea|arXiv (Cornell University)|2013. 11. 12.
Authorship Attribution and Profiling참고 문헌 31인용 수 10
한 줄 요약

이 논문은 저자 소속 분류를 위한 복잡한 네트워크 성질을 기반으로 한 새로운 단어 네트워크 특징을 제안한다. 지역 그래프 특징—특히 정점의 코어니스와 군집 계수—가 벤치마크 데이터셋에서 분류 정확도를 크게 향상시키며, 기존의 단어 빈도 및 요약 그래프 특징을 능가한다. 특히 큰 정지어 대표 집합과 조합했을 때 성능 향상이 두드러진다.

ABSTRACT

In this paper, we explore a set of novel features for authorship attribution of documents. These features are derived from a word network representation of natural language text. As has been noted in previous studies, natural language tends to show complex network structure at word level, with low degrees of separation and scale-free (power law) degree distribution. There has also been work on authorship attribution that incorporates ideas from complex networks. The goal of our paper is to explore properties of these complex networks that are suitable as features for machine-learning-based authorship attribution of documents. We performed experiments on three different datasets, and obtained promising results.

연구 동기 및 목표

  • 기계 학습 기반의 저자 소속 분류에 복잡한 네트워크 특징을 활용할 수 있는지 조사하기.
  • 저자 스타일을 구분하는 데 가장 효과적인 네트워크 성질(지역 대 전역, 빈도 기반 대 비빈도 기반)을 규명하기.
  • 대규모 및 경쟁 수준의 데이터셋(예: AAAC 및 PAN12 포함)에서 이러한 특징의 성능을 평가하여 실제 환경에서의 성능을 점검하기.
  • 기존의 표준 단어 빈도 기반 베이스라인 및 최신 기술 수준의 방법과의 성능 비교하기.

제안 방법

  • 문서에서 고유어를 정점으로, 텍스트 내 인접한 단어를 간선으로 연결하여 단어 네트워크를 구축하기.
  • 정점의 차수, 군집 계수, 코어니스, 이웃 크기, 그래프 요약 통계량(예: 지름, 밀도 등)을 포함한 포괄적인 네트워크 특징을 추출하기.
  • 지정된 단어 집합(예: 상위 500개 빈도 단어, 정지어)을 사용해 지역 특징을 계산함으로써 차원을 축소하고 주목할 만한 스타일적 특징에 집중하기.
  • 단어 빈도와 네트워크 특징을 조합한 문서 수준의 특징 벡터를 기반으로 다양한 분류기(예: Logit Boost, k-NN)를 훈련하고 평가하기.
  • 원시 단어 빈도를 추가했을 때의 영향을 평가하기 위한 아블레이션 연구를 수행하고, 다양한 특징 유형 및 대표 단어 집합 간 성능 비교하기.
  • Gutenberg 데이터셋에서 정보 이득 순위를 적용해 가장 구분력 있는 특징을 식별하고, 특징의 관련성 검증하기.

실험 결과

연구 질문

  • RQ1저자 소속 분류 작업에서 지역 특징과 전역 특징 중 어떤 것이 더 강력한 성능을 낼 수 있는가?
  • RQ2정점의 코어니스와 군집 계수 등 지역 특징은 기존의 단어 빈도 기반 베이스라인과 비교해 어떻게 성능을 냈는가?
  • RQ3지름, 밀도 등의 그래프 요약 특징은 지역 특징에 비해 저자 소속 분류에 얼마나 기여하는가?
  • RQ4대표 단어 집합의 크기가 코어니스 및 군집 계수와 같은 지역 네트워크 특징의 성능에 영향을 미치는가?
  • RQ5AAAC 및 PAN12와 같은 표준화된 저자 소속 분류 경쟁 대회에서 단어 네트워크 특징이 최고의 보고된 성능을 능가하거나 이를 충족시킬 수 있는가?

주요 결과

  • 지역 단어 네트워크 특징, 특히 정점의 코어니스와 군집 계수는 저자 소속 분류 작업에서 전역 그래프 요약 특징을 크게 능가했다.
  • AAAC 데이터셋에서 단어 네트워크 특징은 최고의 테스트 세트 정확도 26.25%를 기록했으며(Logit Boost 사용), 10문제 중 8개에서 보고된 최고 성능을 달성하거나 초월했다.
  • PAN12 데이터셋에서는 Logit Boost를 사용해 최고 정확도 33.53%를 기록했고, 단어 네트워크 특징이 3문제 중 2문제에서 기준선을 뛰어넘었다.
  • 원시 단어 빈도를 추가로 특징으로 삽입했을 때 성능 향상이 미미하거나 없었으며, 이는 네트워크 특징 자체가 이미 매우 구분력이 높다는 것을 시사한다.
  • Gutenberg 데이터셋에서 정보 이득 순위로 상위 20개 특징에 지역 네트워크 특징과 고빈도 정지어가 함께 포함되어 있어, 저자 스타일 예측에 강력한 예측 능력을 지닌다는 점을 확인했다.
  • 정점의 코어니스 성능은 대표 단어 집합의 크기에 민감했으며, 더 작은 집합에서 더 좋은 결과를 보였고, 이는 어휘 크기에 따라 특징 설계를 신중히 해야 한다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.