Skip to main content
QUICK REVIEW

[논문 리뷰] On the State of the Art in Authorship Attribution and Authorship Verification

Jacob Tyo, Bhuwan Dhingra|arXiv (Cornell University)|2022. 09. 14.
Authorship Attribution and Profiling인용 수 7
한 줄 요약

이 논문은 저자 소속 분석(AA)과 저자 소속 검증(AV)을 위한 표준화된 벤치마크인 Valla를 소개한다. 이는 15개 데이터셋에서 8가지 방법 간의 사과에서 사과로의 비교를 가능하게 한다. 놀랍게도, 제한된 데이터로 인한 대부분의 AA 작업에서 N-gram 모델이 BERT 기반 모델보다 뛰어난 성능을 보였지만, 더 큰 데이터셋과 도메인 이동 상황에서는 BERT 기반 모델이 최고 성능을 기록했으며, 특히 AV에서 훈련된 모델에 하드 네거티브 마이닝을 적용할 경우 성능 향상이 두드러졌다.

ABSTRACT

Despite decades of research on authorship attribution (AA) and authorship verification (AV), inconsistent dataset splits/filtering and mismatched evaluation methods make it difficult to assess the state of the art. In this paper, we present a survey of the fields, resolve points of confusion, introduce Valla that standardizes and benchmarks AA/AV datasets and metrics, provide a large-scale empirical evaluation, and provide apples-to-apples comparisons between existing methods. We evaluate eight promising methods on fifteen datasets (including distribution-shifted challenge sets) and introduce a new large-scale dataset based on texts archived by Project Gutenberg. Surprisingly, we find that a traditional Ngram-based model performs best on 5 (of 7) AA tasks, achieving an average macro-accuracy of $76.50\%$ (compared to $66.71\%$ for a BERT-based model). However, on the two AA datasets with the greatest number of words per author, as well as on the AV datasets, BERT-based models perform best. While AV methods are easily applied to AA, they are seldom included as baselines in AA papers. We show that through the application of hard-negative mining, AV methods are competitive alternatives to AA methods. Valla and all experiment code can be found here: https://github.com/JacobTyo/Valla

연구 동기 및 목표

  • 불일치한 데이터셋, 분할 방식, 평가 지표로 인해 발생하는 AA 및 AV 연구의 이질성 문제를 해결하기 위해.
  • AA 및 AV를 위한 데이터셋, 평가 지표, 평가 프로토콜을 표준화한 오픈소스 벤치마크인 Valla를 소개하기 위해.
  • 기존 15개 데이터셋(포함해 Project Gutenberg에서 새롭게 확보한 대규모 데이터셋 포함)에서 8가지 선도적인 AA 및 AV 방법에 대한 대규모 통합 평가를 수행하기 위해.
  • AV 방법이 AA 작업으로 이식 가능한지 조사하고, 하드 네거티브 마이닝의 성능에 미치는 영향을 평가하기 위해.
  • AA의 경우 매크로 정확도, AV의 경우 AUC를 핵심 평가 지표로 설정하고 향후 연구에서의 도입을 촉구하기 위해.

제안 방법

  • 저자들은 일관된 훈련/검증/테스트 분할, 동일한 전처리 방식, 도메인 이동된 테스트 세트를 갖춘 기존 AA 및 AV 데이터셋을 표준화하는 Valla를 구축했다.
  • 공개 도메인 텍스트를 기반으로 한 새로운 대규모 데이터셋을 도입하였으며, 평균 텍스트 길이가 길고 저자 분포가 균형 잡혀 있다.
  • 벤치마크는 AA에 대해 매크로 정확도, AV에 대해 AUC를 사용하여 표준화된 평가를 시행함으로써, 다양한 방법 간의 공정한 비교를 보장한다.
  • N-gram, BERT 기반, LSTM 기반 모델을 포함한 8종의 최첨단 AA 및 AV 모델을 i.i.d. 및 도메인 이동 설정 모두에서 평가하였다.
  • 하드 네거티브 마이닝을 AV 모델(특히 BERT${}_{\text{V}}$)에 적용하여, 트리플릿 손실과 배치 하드 샘플링을 사용해 AA 설정에서의 성능을 향상시켰다.
  • AA 및 AV 방법을 직접 비교하였으며, AV 데이터에서 훈련한 모델을 AA 작업에 맞게 미세조정하였고, 사전 훈련 및 어휘 선택에 대한 분석도 수행하였다.

실험 결과

연구 질문

  • RQ1일관되지 않은 데이터셋 분할 및 평가 프로토콜로 인해 최첨단 AA 및 AV 모델의 성능가 상당한 차이를 보이는가?
  • RQ2적절히 보정된 AV 모델이 하드 네거티브 마이닝을 통해 AA 작업에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ3저자당 텍스트 길이가 증가함에 따라 AA 및 AV 모델의 성능는 어떻게 변화하는가? 특히 N-gram과 트랜스포머 기반 모델을 비교할 때 어떻게 되는가?
  • RQ4도메인 이동이 전통적 방법과 딥러닝 기반 AA 및 AV 방법의 성능에 어떤 영향을 미치는가?
  • RQ5대규모 데이터에서의 사전 훈련이 AA 및 AV 성능에 어떤 영향을 미치며, 일관되게 더 나은 일반화 성능로 이어지는가?

주요 결과

  • 저자당 약 100,000단어 미만의 제한된 데이터로 구성된 7개의 AA 작업 중 5개에서 N-gram 기반 모델이 매크로 정확도 76.50%로 가장 높은 성능을 기록하여 BERT 기반 모델(66.71%)을 능가했다.
  • 저자당 단어 수가 가장 많은 두 개의 AA 데이터셋인 IMDb62와 Blogs50에서는 BERT 기반 모델이 각각 98.81%와 74.95%의 매크로 정확도로 최고 성능을 기록했다.
  • 공개 도메인 장문 텍스트를 기반으로 한 새로운 Gutenberg 데이터셋은, 충분한 훈련 데이터가 확보된 경우 BERT 기반 모델이 N-gram을 능가함을 보여주었다.
  • AA 작업에 적용했을 때 AV 모델(예: BERT${}_{\text{V}}$)은 평균적으로 AA 모델보다 매크로 정확도에서 15%p 이상 떨어졌으며, 각각 59.89% 대 76.80%였다.
  • 하드 네거티브 마이닝을 통해 BERT${}_{\text{V}}$의 AA 작업에서의 매크로 정확도는 67.21%에서 72.42%로 향상되었으며, 전용 AA 모델과의 성능 격차를 크게 줄였다. 이와 동시에 AV의 AUC 성능도 유지되었다.
  • 연구는 AV 형식이 딥러닝 모델 훈련에 더 효과적임을 확인하였으며, 균형 잡힌 이진 분류 설정이 최적화 및 일반화에 유리하다는 점을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.