[논문 리뷰] An Investigation of Supervised Learning Methods for Authorship Attribution in Short Hinglish Texts using Char & Word N-grams.
이 연구는 문자 및 단어 n-gram을 사용하여 짧은 힌글리시 문장(힌디어와 영어의 혼합어)에서 저자 특정을 위한 지도 학습 방법을 조사한다. 지원 벡터 기반 분류기(SVM)가 문자 3-gram과 단어 유니그램을 조합하여 최대 95.079%의 정확도를 기록하며 다른 모델과 특징 유형보다 뛰어나며, 이는 소자원, 비표준 매크로닉 언어가 소셜 미디어 환경에서 n-gram 기반 접근 방식의 타당성을 입증한다.
The writing style of a person can be affirmed as a unique identity indicator; the words used, and the structuring of the sentences are clear measures which can identify the author of a specific work. Stylometry and its subset - Authorship Attribution, have a long history beginning from the 19th century, and we can still find their use in modern times. The emergence of the Internet has shifted the application of attribution studies towards non-standard texts that are comparatively shorter to and different from the long texts on which most research has been done. The aim of this paper focuses on the study of short online texts, retrieved from messaging application called WhatsApp and studying the distinctive features of a macaronic language (Hinglish), using supervised learning methods and then comparing the models. Various features such as word n-gram and character n-gram are compared via methods viz., Naive Bayes Classifier, Support Vector Machine, Conditional Tree, and Random Forest, to find the best discriminator for such corpora. Our results showed that SVM attained a test accuracy of up to 95.079% while similarly, Naive Bayes attained an accuracy of up to 94.455% for the dataset. Conditional Tree & Random Forest failed to perform as well as expected. We also found that word unigram and character 3-grams features were more likely to distinguish authors accurately than other features.
연구 동기 및 목표
- WhatsApp에서 수집한 짧고 비공식적인 힌글리시 텍스트에서 저자 특정을 위한 지도 학습 방법을 평가하기 위해.
- 맥아론닉 언어에서 저자를 구분하는 데에 단어 n-gram과 문자 n-gram이 얼마나 효과적인 언어학적 특징인지 평가하기 위해.
- 힌글리시 어휘집에서 나이브 베이즈, SVM, 조건부 트리, 랜덤 포레스트 분류기의 성능을 비교하기 위해.
- 비표준, 혼합어 언어 텍스트에서 저자 특정을 위한 최적의 특징 유형(n-gram 순서)과 특징 가중치 방식(이진, TF, TF-IDF)을 특정하기 위해.
- 힌글리시에서의 개인적 철자법과 문법 패턴이 저자 특정에 신뢰할 수 있는 식별자로 기능할 수 있는지 탐색하기 위해.
제안 방법
- 네 명의 저자로부터 개인 메시지와 그룹 메시지를 포함해 총 76,000단어의 짧은 힌글리시 텍스트를 WhatsApp에서 수집하였다.
- 언어학적 특징으로서 단어 n-gram(유니그램부터 트라이그램까지)과 문자 n-gram(최대 트라이그램까지)을 추출하였다.
- 세 가지 특징 가중치 방식을 적용: 이진 가중치, 어휘 빈도(TF), TF-IDF.
- 나이브 베이즈, 지원 벡터 기반 분류기(SVM), 조건부 트리, 랜덤 포레스트의 네 가지 지도 학습 분류기를 훈련 및 평가하였다.
- 모든 모델과 특징 조합에 대해 안정적인 성능 추정을 확보하기 위해 10겹 교차 검증을 사용하였다.
- 정확도, 진짜 양성 비율(TPR), 정밀도 등의 표준 지표를 사용해 모델을 평가하였다.
실험 결과
연구 질문
- RQ1짧은 힌글리시 텍스트에서 저자 특정에 가장 잘 작동하는 지도 학습 알고리즘이 무엇인가?
- RQ2맥아론닉 언어에서 저자 특정의 분류 정확도를 높이는 데에 단어 n-gram인지 문자 n-gram인지가 더 효과적인가?
- RQ3이진, TF, TF-IDF와 같은 다양한 특징 가중치 방식은 힌글리시 어휘집에서 모델 성능에 어떻게 영향을 미치는가?
- RQ4짧고 흐린 힌글리시 텍스트에서 고차수 n-gram(예: 바이그램, 트라이그램)을 사용할 경우 성능이 크게 떨어지는가?
- RQ5힌글리시에서의 개인적 철자법과 문법 패턴은 저자 특정을 위한 구분 특징으로 효과적인가?
주요 결과
- SVM가 문자 3-gram을 사용하여 최고의 테스트 정확도 95.079%를 기록하며, 모든 다른 모델을 앞서며 뛰어난 성능을 보였다.
- 나이브 베이즈는 단어 유니그램을 사용하여 최대 정확도 94.455%를 기록하며, 모든 모델 중 두 번째로 높은 성능을 보였다.
- 조건부 트리와 랜덤 포레스트는 성능이 열등하여, 주어진 특징 세트에서는 이 작업에 적합하지 않다는 것이 확인되었다.
- 단어 유니그램과 문자 3-gram이 가장 효과적인 특징이었으며, 고차수 n-gram에서는 성능이 뚜렷이 저하되었다.
- 이진 가중치가 가장 우수한 전체 성능을 보였고, 그 다음으로 어휘 빈도가 뒤를 이었다; TF-IDF는 의사결정 트리와 랜덤 포레스트에서는 SVM이나 나이브 베이즈보다 더 나은 성능을 보였다.
- 이 연구는 형태학적 풍부성, 비표준 철자법, 힌글리시에서의 사용자 고유의 문법이 n-gram 특징을 통해 포착될 경우 신뢰할 수 있는 저자 식별자로 기능할 수 있음을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.