Skip to main content
QUICK REVIEW

[論文レビュー] Identifying Semantically Duplicate Questions Using Data Science Approach: A Quora Case Study

Navedanjum Ansari, Rajesh Sharma|arXiv (Cornell University)|Apr 18, 2020
Topic Modeling被引用数 8
ひとこと要約

本論文では、機械学習およびディープラーニング技術を用いてQuoraにおける意味的に重複する質問を検出するデータサイエンス的手法を提案する。特徴工学、XGBoostと文字レベルTF-IDFの組み合わせ、および4つのディープニューラルネットワークアーキテクチャを統合することで、最良のモデルは85.82%の精度に達し、従来の機械学習モデルを上回り、Quoraの最先端性能に近づいた。

ABSTRACT

Identifying semantically identical questions on, Question and Answering social media platforms like Quora is exceptionally significant to ensure that the quality and the quantity of content are presented to users, based on the intent of the question and thus enriching overall user experience. Detecting duplicate questions is a challenging problem because natural language is very expressive, and a unique intent can be conveyed using different words, phrases, and sentence structuring. Machine learning and deep learning methods are known to have accomplished superior results over traditional natural language processing techniques in identifying similar texts. In this paper, taking Quora for our case study, we explored and applied different machine learning and deep learning techniques on the task of identifying duplicate questions on Quora's dataset. By using feature engineering, feature importance techniques, and experimenting with seven selected machine learning classifiers, we demonstrated that our models outperformed previous studies on this task. Xgboost model with character level term frequency and inverse term frequency is our best machine learning model that has also outperformed a few of the Deep learning baseline models. We applied deep learning techniques to model four different deep neural networks of multiple layers consisting of Glove embeddings, Long Short Term Memory, Convolution, Max pooling, Dense, Batch Normalization, Activation functions, and model merge. Our deep learning models achieved better accuracy than machine learning models. Three out of four proposed architectures outperformed the accuracy from previous machine learning and deep learning research work, two out of four models outperformed accuracy from previous deep learning study on Quora's question pair dataset, and our best model achieved accuracy of 85.82% which is close to Quora state of the art accuracy.

研究の動機と目的

  • Quoraにおける意味的に同一の質問の検出を向上させ、コンテンツの質とユーザーエクスペリエンスを向上させること。
  • 自然言語の多様性という課題に対処すること。同じ意図が異なる語句や構造で表現されるためである。
  • Quoraの質問ペアデータセット上で機械学習およびディープラーニングモデルの評価と比較を行うこと。
  • 重複する質問検出に最も効果的な特徴工学とモデルアーキテクチャの組み合わせを特定すること。

提案手法

  • 文字レベルの項頻度と逆項頻度(TF-IDF)特徴を用いた特徴工学を適用した。
  • 7つの機械学習分類器を評価し、XGBoostが最も優れた性能を示した。
  • GloVe単語埋め込み、LSTM、畳み込み層、マックスプーリング、バッチ正則化、ReLU活性化関数を用いた4つのディープニューラルネットワークアーキテクチャを設計した。
  • 一般化性能と学習安定性を向上させるために、全結合層、ドロップアウト層、バッチ正則化層を複数層統合した。
  • 複数のディープラーニングアーキテクチャからの予測を統合するモデル統合技術を用いて性能を向上させた。
  • 精度を主評価指標として用い、Quoraの質問ペアデータセット上でモデルを訓練および検証した。

実験結果

リサーチクエスチョン

  • RQ1特徴工学を施した機械学習モデルは、Quoraにおける意味的に重複する質問の検出において、従来のアプローチを上回ることができるか?
  • RQ2ディープニューラルネットワークアーキテクチャは、従来の機械学習モデルと比較して、重複する質問検出の精度において優れているか?
  • RQ3このタスクにおける文字レベルTF-IDF特徴のモデル性能への影響は何か?
  • RQ4アンサンブルまたは統合されたディープラーニングモデルは、Quoraデータセットで最先端の結果を上回ることができるか?
  • RQ5この分類タスクにおいて、最適なニューラルネットワークコンponentsの組み合わせ(例:LSTM、CNN、正則化)は何か?

主な発見

  • 文字レベルTF-IDF特徴を用いたXGBoostモデルが、テストしたすべての機械学習モデルの中で最高の精度を達成した。
  • 最良のディープラーニングモデルは85.82%の精度に達し、Quoraの最先端性能に非常に近い水準であった。
  • 4つのディープラーニングアーキテクチャのうち3つが、Quoraデータセット上で従来の機械学習およびディープラーニング研究を上回った。
  • 4つのディープラーニングモデルのうち2つが、同じデータセット上で従来のディープラーニング研究の精度を上回った。
  • 特徴重要度分析により、文字レベル特徴がモデル性能に顕著に寄与していることが確認された。
  • バッチ正則化とReLU活性化関数の統合により、すべてのディープラーニングアーキテクチャにおいて学習収束性とモデル一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。