Skip to main content
QUICK REVIEW

[논문 리뷰] Author2Vec: A Framework for Generating User Embedding

Xiaodong Wu, Weizhe Lin|arXiv (Cornell University)|2020. 03. 17.
Authorship Attribution and Profiling참고 문헌 41인용 수 9
한 줄 요약

Author2Vec는 BERT로 인코딩된 문장 표현과 10,000명의 Reddit 사용자에 대해 새로운 비지도 사전학습 목표인 저자 식별 분류를 활용하여 사용자 임베딩을 생성하는 엔드 투 엔드 신경망 프레임워크를 제안한다. 이 방법은 피로도 탐지 및 MBTI 성격 분류와 같은 후행 작업에서 전통적인 카운트 기반 및 예측 기반 기준보다 우수한 성능을 보이며, 미세조정 없이도 최신 기술 수준의 F1 스코어를 달성한다.

ABSTRACT

Online forums and social media platforms provide noisy but valuable data every day. In this paper, we propose a novel end-to-end neural network-based user embedding system, Author2Vec. The model incorporates sentence representations generated by BERT (Bidirectional Encoder Representations from Transformers) with a novel unsupervised pre-training objective, authorship classification, to produce better user embedding that encodes useful user-intrinsic properties. This user embedding system was pre-trained on post data of 10k Reddit users and was analyzed and evaluated on two user classification benchmarks: depression detection and personality classification, in which the model proved to outperform traditional count-based and prediction-based methods. We substantiate that Author2Vec successfully encoded useful user attributes and the generated user embedding performs well in downstream classification tasks without further finetuning.

연구 동기 및 목표

  • 사용자 지정 미세조정 없이 소셜 미디어 텍스트에서 내재된 사용자 특성을 포괄하는 엔드 투 엔드 사용자 임베딩 시스템을 개발하는 것.
  • 사용자 특성 분류에서 수동 특징 공학의 한계를 해결하기 위해 구분력 있고 일반화 가능한 사용자 표현을 학습하는 것.
  • 사전 훈련된 사용자 임베딩이 최소한의 적응으로 다양한 후행 작업에 일반화되는지 평가하는 것.
  • 비지도 사전학습을 통해 저자 식별을 프록시 목표로 삼아 의미 있는 사용자 표현을 학습하는 데의 효과성을 탐색하는 것.

제안 방법

  • 프레임워크는 사용자 게시물을 문맥 기반 문장 임베딩으로 인코딩하기 위해 BERT를 사용한다.
  • 이 문장 임베딩을 바탕으로, 동일한 사용자 게시물의 저자를 후보 저자 목록에서 예측하는 새로운 비지도 사전학습 목표를 적용한다.
  • 사용자 임베딩은 동일한 사용자가 작성한 모든 게시물의 BERT로 인코딩된 표현을 평균 풀링 등의 방식으로 집계하여 생성된다.
  • 데이터 누출을 방지하기 위해 주제 기반 콘텐츠에서 비롯된 영향을 최소화하기 위해 정제된 고품질 게시물로 10,000명의 Reddit 사용자 데이터를 기반으로 사전학습한다.
  • 사전학습 후, 추가적인 미세조정 없이 로지스틱 회귀를 사용하여 후행 분류 작업에서 학습된 사용자 임베딩을 평가한다.
  • 프레임워크는 정밀하게 셋업된 Reddit 데이터셋을 사용하여 두 가지 벤치마크에서 평가된다: 우울증 탐지 및 MBTI 성격 분류.

실험 결과

연구 질문

  • RQ1저자 식별 기반의 비지도 사전학습 목표가 의미 있는 사용자 임베딩을 효과적으로 학습할 수 있는가?
  • RQ2사전 훈련된 사용자 임베딩이 미세조정 없이 후행 분류 작업에 얼마나 잘 일반화되는가?
  • RQ3Author2Vec가 전통적인 카운트 기반(예: LDA, TF-IDF-LSI) 및 예측 기반(예: Word2Vec) 방법보다 사용자 특성을 더 잘 포착하는가?
  • RQ4학습된 임베딩이 성격 및 정신 건강 상태와 같은 내재된 사용자 특성을 어느 정도 반영하는가?

주요 결과

  • MBTI 분류에서 Author2Vec는 E/I 차원에서 F1 스코어 0.690, S/N에서 0.766, T/F에서 0.681, J/P에서 0.610을 기록하여 모든 기준 모델을 능가했다.
  • 우울증 탐지 벤치마크에서 모델은 강력한 성능을 보였으며, 시각화 기반 분석에서 성별 분류 F1 스코어가 93.3%였다.
  • 16형 MBTI 분류의 혼동 행렬은 클러스터링 향상과 오분류 감소를 보였으며, 특히 희귀 유형에서 두드러진 개선이 있었다.
  • 불균형 데이터셋에서도 성능이 일관되었으며, 기준 모델 대비 희귀 클래스에서 더 우수한 F1 스코어를 기록했다.
  • MBTI 벤치마크 전반에서 Author2Vec는 TF-IDF-LSI, LDA, Word2Vec 기준 모델을 모두 압도했다.
  • 결과는 비지도 저자 식별 분류 목표가 비트리비얼한 내재된 사용자 수준의 언어적 및 행동 패턴을 효과적으로 포착했다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.