Skip to main content
QUICK REVIEW

[論文レビュー] Question Retrieval for Community-based Question Answering via Heterogeneous Network Integration Learning

Zheqian Chen, Chi Zhang|arXiv (Cornell University)|Nov 24, 2016
Expert finding and Q&A systems参考文献 30被引用数 4
ひとこと要約

本稿では、ランダムウォークとRNNベースの表現学習を用いて、質問のテキスト、ユーザのソーシャルネットワーク、カテゴリ情報の3つを統合的にモデル化することで、コミュニティベースの質問応答(CQA)における質問検索の性能を向上させる、異種ネットワーク統合学習フレームワークであるHNILを提案する。Quoraデータを用いた実験では、最先端手法を著しく上回り、MRRが最大53.22%、MAPが40.67%に達する結果を得ており、セマンティックな質問マッチングにソーシャル信号とテキスト信号を統合する有効性が示された。

ABSTRACT

Community based question answering platforms have attracted substantial users to share knowledge and learn from each other. As the rapid enlargement of CQA platforms, quantities of overlapped questions emerge, which makes users confounded to select a proper reference. It is urgent for us to take effective automated algorithms to reuse historical questions with corresponding answers. In this paper we focus on the problem with question retrieval, which aims to match historical questions that are relevant or semantically equivalent to resolve one s query directly. The challenges in this task are the lexical gaps between questions for the word ambiguity and word mismatch problem. Furthermore, limited words in queried sentences cause sparsity of word features. To alleviate these challenges, we propose a novel framework named HNIL which encodes not only the question contents but also the askers social interactions to enhance the question embedding performance. More specifically, we apply random walk based learning method with recurrent neural network to match the similarities between askers question and historical questions proposed by other users. Extensive experiments on a large scale dataset from a real world CQA site show that employing the heterogeneous social network information outperforms the other state of the art solutions in this task.

研究の動機と目的

  • 語彙的ギャップや語彙の希少性が原因で生じる質問検索の課題を解消すること。
  • 語彙的オーバーラップのない、意味的に同等の質問同士のセマンティックマッチングを改善すること。
  • ユーザのソーシャルネットワーク相互作用と質問のカテゴリ情報といった補助信号を活用し、質問埋め込みの品質を向上させること。
  • テキスト、社会的、分類的情報を統合する包括的なフレームワークを構築し、検索性能を向上させること。
  • 実世界のCQA環境において、従来の非教師ありまたはテキストオンリー手法と比較して、教師ありのマルチモodal学習が優れていることを実証すること。

提案手法

  • ユーザ、質問、カテゴリを統合した異種ネットワーク上でランダムウォークを実行し、ユーザおよび質問のパスシーケンスを生成する。
  • 双方向RNNを用いて、ランダムウォークで得られたノードシーケンスを、文脈に配慮した高次元埋め込みに符号化する。
  • RNNで学習したユーザ埋め込みを、別途RNNで得た質問のテキスト埋め込みと連結し、統一された質問表現を構築する。
  • 類似する質問同士の類似度を最大化し、非類似のペairの類似度を最小化するように、対照的損失関数を用いてモデルをエンドツーエンドで学習する。
  • 質問のカテゴリ情報を教師信号として統合し、表現学習をガイドし、カテゴリ内類似度を向上させる。
  • 学習済みの埋め込みを用いて、新しいクエリ質問と類似度が高い歴史的質問を順序付けして検索する。

実験結果

リサーチクエスチョン

  • RQ1ユーザのソーシャルネットワーク相互作用を統合することで、CQAプラットフォームにおける質問のセマンティック表現が向上するか?
  • RQ2テキストコンテンツに加えて、ユーザ側の情報(例:ソーシャルネットワーク)を組み合わせることで、テキストオンリーのモデルと比較して検索性能がどのように向上するか?
  • RQ3カテゴリの監視信号が、意味的に意味のある質問埋め込みの学習にどの程度寄与するか?
  • RQ4異種ネットワークに基づくランダムウォーク戦略は、ユーザと質問の間の潜在的関係を効果的に捉えられるか?
  • RQ5テキスト、社会的、分類的信号を統合的にモデル化するディープラーニングフレームワークは、最先端の教師ありおよび非教師ありベースラインを上回るか?

主な発見

  • HNILは全指標で最高の性能を達成し、80%の訓練データでMRRが53.22%、MAPが40.67%に達し、すべてのベースラインを著しく上回った。
  • 80%の訓練データでPrecision@5が41.01%に達し、トップ5の検索精度が優れていることが示された。
  • 60%のデータで学習した場合でも、MRRが47.90%に達し、限られたラベル付きデータでも頑健であることが確認された。
  • アブレーションスタディの結果、パス長が6のときに全指標で最適な性能を示し、ハイパーパrameter選択の感受性が裏付けられた。
  • 教師あり手法(HNIL、DRLM、RCNNs)は、非教師あり手法(例:VSM、BM25、Doc2Vec)を常に上回り、カテゴリ監視の価値が裏付けられた。
  • ソーシャルネットワーク情報とテキストコンテンツの統合により、テキストオンリーのモデルと比較してMRRが15–20%相対的に向上し、フレームワーク設計の有効性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。