Skip to main content
QUICK REVIEW

[논문 리뷰] Identifying Semantically Duplicate Questions Using Data Science Approach: A Quora Case Study

Navedanjum Ansari, Rajesh Sharma|arXiv (Cornell University)|2020. 04. 18.
Topic Modeling인용 수 8
한 줄 요약

이 논문은 기계 학습 및 딥 러닝 기법을 활용하여 Quora에서 의미적으로 동일한 질문을 탐지하기 위한 데이터 과학 접근법을 제안한다. 특성 공학, 문자 수준 TF-IDF를 사용한 XGBoost, 그리고 네 가지 딥 네트워크 아키텍처를 조합함으로써, 최고의 모델은 85.82%의 정확도를 달성하였으며, 이는 이전의 기계 학습 모델을 뛰어넘고 Quora의 최신 기술 수준에 가까워졌다.

ABSTRACT

Identifying semantically identical questions on, Question and Answering social media platforms like Quora is exceptionally significant to ensure that the quality and the quantity of content are presented to users, based on the intent of the question and thus enriching overall user experience. Detecting duplicate questions is a challenging problem because natural language is very expressive, and a unique intent can be conveyed using different words, phrases, and sentence structuring. Machine learning and deep learning methods are known to have accomplished superior results over traditional natural language processing techniques in identifying similar texts. In this paper, taking Quora for our case study, we explored and applied different machine learning and deep learning techniques on the task of identifying duplicate questions on Quora's dataset. By using feature engineering, feature importance techniques, and experimenting with seven selected machine learning classifiers, we demonstrated that our models outperformed previous studies on this task. Xgboost model with character level term frequency and inverse term frequency is our best machine learning model that has also outperformed a few of the Deep learning baseline models. We applied deep learning techniques to model four different deep neural networks of multiple layers consisting of Glove embeddings, Long Short Term Memory, Convolution, Max pooling, Dense, Batch Normalization, Activation functions, and model merge. Our deep learning models achieved better accuracy than machine learning models. Three out of four proposed architectures outperformed the accuracy from previous machine learning and deep learning research work, two out of four models outperformed accuracy from previous deep learning study on Quora's question pair dataset, and our best model achieved accuracy of 85.82% which is close to Quora state of the art accuracy.

연구 동기 및 목표

  • Quora에서 의미적으로 동일한 질문을 탐지함으로써 콘텐츠 품질과 사용자 경험을 향상시키는 것.
  • 자연어의 다양성에 도전하는 것 — 동일한 의도가 다른 어휘와 문장 구조로 표현되는 경우.
  • Quora 질문 쌍 데이터셋에서 기계 학습 및 딥 러닝 모델을 평가하고 비교하는 것.
  • 이중 질문 탐지에 가장 효과적인 특성 공학 및 모델 아키텍처 조합을 규명하는 것.

제안 방법

  • 문자 수준의 어간 빈도와 역어간 빈도(TF-IDF) 특성을 사용한 특성 공학을 적용함.
  • 일곱 가지 기계 학습 분류기 평가 중에서 XGBoost가 가장 높은 성능을 보였음.
  • GloVe 단어 임베딩, LSTM, 합성곱층, 최대 풀링, 배치 정규화, ReLU 활성화 함수를 사용한 네 가지 딥 네트워크 아키텍처 설계.
  • 일반화 및 학습 안정성 향상을 위해 밀집층, 드롭아웃, 배치 정규화 등의 다중 레이어 통합.
  • 여러 딥 러닝 아키텍처의 예측을 통합하여 성능 향상을 위한 모델 융합 기법 사용.
  • 정확도를 주요 평가 지표로 사용하여 Quora 질문 쌍 데이터셋에서 모델을 학습 및 검증함.

실험 결과

연구 질문

  • RQ1공학된 특성을 사용한 기계 학습 모델이 이전 접근 방식을 뛰어넘어 Quora에서 의미적으로 동일한 질문을 탐지하는 데 성능이 뛰어나게 되는가?
  • RQ2이중 질문 탐지에서 딥 네트워크 아키텍처가 전통적인 기계 학습 모델보다 정확도 측면에서 어떻게 비교되는가?
  • RQ3이 작업에서 문자 수준의 TF-IDF 특성이 모델 성능에 어떤 영향을 미치는가?
  • RQ4앙상블 또는 융합된 딥 러닝 모델이 Quora 데이터셋에서 최신 기술 수준의 성능을 뛰어넘을 수 있는가?
  • RQ5이 분류 작업에 최적의 신경망 구성 요소 조합(예: LSTM, CNN, 정규화 등)은 무엇인가?

주요 결과

  • 문자 수준의 TF-IDF 특성을 사용한 XGBoost 모델이 테스트된 모든 기계 학습 모델 중에서 가장 높은 정확도를 기록함.
  • 최고의 딥 러닝 모델은 85.82%의 정확도를 달성하였으며, 이는 Quora의 최신 기술 수준에 매우 가까운 성능임.
  • 네 가지 딥 러닝 아키텍처 중 세 개가 이전의 기계 학습 및 딥 러닝 연구를 모두 뛰어넘는 성능을 보였음.
  • 네 가지 딥 러닝 모델 중 두 개가 동일한 데이터셋에서 이전의 딥 러닝 연구 성능을 초월함.
  • 특성 중요도 분석 결과, 문자 수준의 특성이 모델 성능 향상에 크게 기여함을 확인함.
  • 배치 정규화와 ReLU 활성화 함수의 통합으로 모든 딥 러닝 아키텍처에서 학습 수렴성과 모델 일반화 능력 향상이 이루어짐.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.