[논문 리뷰] Personality Type Based on Myers-Briggs Type Indicator with Text Posting Style by using Traditional and Deep Learning
이 연구는 전통적(나이브 베이즈, 서포트 벡터 머신) 및 딥 러닝(순환 신경망) 모델을 사용하여 텍스트 게시물에서 마이어스-브리그스 유형 지표(MBТИ) 성격 유형을 예측하기 위한 머신러닝 프레임워크를 제안한다. 단어 임bed딩과 양방향 LSTM를 활용한 RNN 기반 접근 방식이 모든 네 가지 MBTI 차원에서 다른 모델을 앞서며 가장 높은 정확도를 기록했으며, F1 점수 평균은 약 76%였다.
The term personality may be expressed in terms of the individual differences in characteristics pattern of thinking, feeling, and behavior. This work presents several machine learning techniques including Naive Bayes, Support Vector Machines, and Recurrent Neural Networks to predict people personality from text based on Myers-Briggs Type Indicator (MBTI). Furthermore, this project applies CRISP-DM, which stands for Cross-Industry Standard Process for Data Mining, to guide the learning process. Since, CRISP-DM is kind of iterative development, we have adopted it with agile methodology, which is a rapid iterative software development method, in order to reduce the development cycle to be minimal.
연구 동기 및 목표
- 소셜 미디어 텍스트 게시물에서 MBTI 성격 유형을 예측하기 위한 기계학습 기반 시스템을 개발하는 것.
- MBTI 분류에 대해 전통적 기계학습 모델(나이브 베이즈, 서포트 벡터 머신)과 딥 러닝(RNN)의 성능을 비교하는 것.
- 반복적인 성격 예측 모델 개발을 효율화하기 위해 CRISP-DM 프레임워크와 애자일 방법론을 적용하는 것.
- 모델 성능을 네 가지 MBTI 차원(예: 인지 vs. 판단) 전반에서 평가하고 분류 약점 파악하기.
- 포럼 기반 텍스트 데이터(예: 성격 카페)가 기계학습을 통한 성격 예측에 신뢰할 수 있는 자료로 활용될 수 있는지 탐색하는 것.
제안 방법
- 반복적인 데이터 마이닝 및 모델 개발을 위해 CRISP-DM 프레임워크와 애자일 방법론을 활용하였다.
- URL, 특수 문자, 불용어 제거 및 케이스 정규화, 어간 추출을 통해 텍스트 데이터를 전처리하였다.
- Scikit-learn를 사용해 다항 나이브 베이즈(multinomial-NB)와 선형 커널 및 정규화를 적용한 서포트 벡터 머신(SVM)을 구현하였다.
- TensorFlow를 사용해 단어 임베딩(어휘 크기 256), 순차적 특징 추출을 위한 CONV1D 레이어, 양방향 컨텍스트 학습을 위한 양방향 LSTM(64 유닛)을 포함한 딥 러닝 모델을 구축하였다.
- Scikit-learn의 train_test_split 함수를 사용해 데이터셋을 75% 훈련용, 25% 테스트용으로 분할하였다.
- 혼동 행렬, 분류 보고서, F1 점수 메트릭을 사용해 정밀도, 재현도, F1 점수를 평가하여 모든 MBTI 유형에 대한 성능을 분석하였다.
실험 결과
연구 질문
- RQ1나이브 베이즈, 서포트 벡터 머신, 또는 순환 신경망 중에서 텍스트에서 MBTI 성격 유형을 예측하는 데 가장 우수한 성능을 보이는 기계학습 모델은 무엇인가?
- RQ2모델의 성능는 네 가지 MBTI 차원(예: 인지 대 비판) 간에 어떻게 다를까?
- RQ3양방향 LSTM와 단어 임베딩을 사용할 경우 기존 모델 대비 분류 정확도 향상 정도는 어느 정도인가?
- RQ4일부 MBTI 유형을 정확히 분류하는 데 어려움이 있는 이유는 무엇이며, 혼동 행렬은 잘못된 분류 패턴을 어떻게 드러내는가?
- RQ5성격 카페와 같은 포럼에서의 소셜 미디어 텍스트는 기계학습을 통한 신뢰할 수 있는 성격 예측에 유효한 데이터 소스로 활용될 수 있는가?
주요 결과
- 순환 신경망(RNN) 모델이 네 가지 MBTI 성격 유형 전반에서 가장 높은 전체 정확도를 기록했으며, 나이브 베이즈와 SVM을 모두 앞섰다.
- RNN 모델의 F1 점수 평균은 약 76%로, 모든 클래스에서 정밀도와 재현도의 균형 잡힌 성능을 보였다.
- RNN 모델의 혼동 행렬은 대부분의 예측가 true positive로 분류되었으며, 상대적으로 적은 수의 false positive가 관찰되어 강력한 분류 일관성을 보였다.
- 나이브 베이즈와 SVM 모델은 RNN 모델 대비 인지(P) 및 판단(J) 차원에서 상당히 낮은 정확도를 보였다.
- 분류 보고서(그림 13 및 14)는 RNN 모델이 특히 더 어려운 차원에서 높은 정밀도와 재현도를 유지하고 있음을 확인했다.
- 전반적으로 우수한 성능를 보였음에도 불구하고, 모든 네 가지 MBTI 차원을 정확히 분류하는 데 일반적인 약점이 존재하여 데이터셋 내 본질적 모호성 또는 데이터 불균형이 원인일 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.