Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised authorship attribution

David A. Fifield, Torbjørn Follan|arXiv (Cornell University)|2015. 03. 26.
Authorship Attribution and Profiling참고 문헌 9인용 수 4
한 줄 요약

이 논문은 글쓰기 스타일에 대한 사전 지식 없이, 다중 겹치는 조각 클러스터링을 사용하여 텍스트 조각에 확률적 소유자 가중치를 할당하는 비지도 저자 할당 방법을 제안한다. 여러 클러스터링에서 조각 경계를 이동시키고 쌍별 일치를 통해 레이블을 정렬함으로써, 저자 할당에 대해 미세한 해상도와 부드러운 전환을 달성하였으며, 성경 텍스트 분할에서 실제값과 72% 일치를 보였다.

ABSTRACT

We describe a technique for attributing parts of a written text to a set of unknown authors. Nothing is assumed to be known a priori about the writing styles of potential authors. We use multiple independent clusterings of an input text to identify parts that are similar and dissimilar to one another. We describe algorithms necessary to combine the multiple clusterings into a meaningful output. We show results of the application of the technique on texts having multiple writing styles.

연구 동기 및 목표

  • 학습 데이터나 저자들의 사전 스타일 지식이 없는 텍스트에서 저자 할당 문제를 해결한다.
  • 저자 전환이 점진적이거나 명시되지 않은 경우에도 텍스트 조각을 다수의 저자에게 미세하게 할당할 수 있도록 한다.
  • 스타일적 대표성(조각 길이)과 전환 감지 해상도 사이의 상충 관계를 해결한다.
  • 다양한 독립적 클러스터링을 통합하여 일관된 평균 저자 할당을 도출할 수 있는 강건한 방법을 개발한다.
  • 임의의 레이블 부여 체계에도 불구하고 쌍별 일치 최적화를 통해 클러스터링 간 레이블 일관성을 확보한다.

제안 방법

  • 고정 길이(예: 1000단어)의 겹치는 조각으로 입력 텍스트를 분할하고, 후속 이동(예: 50단어)을 통해 다중 조각 세트를 생성한다.
  • 각 조각 세트에 대해 독립적인 클러스터링(예: 스타일로미트릭 특징 또는 압축 기반 유사도 사용)을 적용하여 스타일적으로 유사한 세그먼트를 그룹화한다.
  • 다른 실행 간 클러스터 식별자를 정렬하기 위해 순열 전략을 사용하여 모든 클러스터링 간 레이블을 재할당한다.
  • 재할당된 클러스터링의 평균을 계산하여 각 세그먼트가 n명의 저자 중 각각에게 할당되는 소프트, 확률적 할당을 도출한다.
  • 클러스터링을 위해 JStylo의 'WritePrints (Limited)' 기능 세트를 사용하여 조각에서 스타일로미트릭 특징을 추출한다.
  • 고차원 특징 벡터에서의 클러스터링 성능 향상을 위해 차원 감소(예: 무작위 투영을 통한)를 적용한다.

실험 결과

연구 질문

  • RQ1사전에 알려진 저자에 대해 학습하지 않은 상태에서 겹치는 텍스트 조각의 비지도 클러스터링이 저자 전환을 신뢰성 있게 탐지할 수 있는가?
  • RQ2단일 클러스터링 접근 방식과 비교해 볼 때, 겹치는 조각 클러스터링은 저자 할당의 해상도와 부드러움을 어떻게 향상시키는가?
  • RQ3다중 클러스터링 간 레이블 정렬은 저자 할당의 노이즈를 어느 정도 감소시키고 일관성을 향상시키는가?
  • RQ4저자 전환이 점진적이거나 명확히 구분되지 않는 실제 텍스트에 대해 이 방법은 얼마나 효과적인가?
  • RQ5이 비지도 설정에서 차원 감소는 클러스터링 품질과 할당 정확도에 어떤 영향을 미치는가?

주요 결과

  • 이 방법은 '아폴로 찬가'의 델로스 부분 1768단어 분할에서 실제값과 72% 일치를 보이며 실제 다저자 텍스트에서 뛰어난 성능을 입증하였다.
  • 피티아노스 부분의 3726단어 분할에 적용했을 때, 실제값과 최대 약 76% 일치를 기록하여 더 긴 세그먼트에서도 높은 신뢰성을 보였다.
  • 차원 감소(예: 무작위 투영)를 사용함으로써 클러스터링 성능이 향상되었으며, 번역된 찬가에서 감소 후 일치율이 56%에서 72%로 증가하였다.
  • 이 방법은 특히 저자 전환이 점진적인 영역에서 부드러운 레이블 전환을 성공적으로 포착하였으며, 그림 5.2에서 이를 확인할 수 있었다.
  • 레이블 순열 및 평균화를 통해 레이블 일관성 문제를 줄임으로써, 기준 클러스터링 방법보다 우수한 성능을 보였다.
  • 이 방법은 조각 크기와 이동 오프셋의 선택에 대해 강건하며, 20개의 겹치는 클러스터링(1000단어 조각, 50단어 이동)이 최적의 해상도와 안정성을 제공하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.