Skip to main content
QUICK REVIEW

[論文レビュー] A Study of Question Effectiveness Using Reddit "Ask Me Anything" Threads

Kristjan Arumae, Guo-Jun Qi|arXiv (Cornell University)|May 25, 2018
Expert finding and Q&A systems参考文献 19被引用数 3
ひとこと要約

本論文では、40万件の質問を含む大規模なデータセットを用いて、Redditの『Ask Me Anything』(AMA)スレッドにおけるホストがどの質問に答えているかを予測する文脈に配慮した畳み込みニューラルネットワーク(CNN)を提案している。モデルは1万件の検証セットで53.7%のF1スコアを達成し、ベースラインを上回っており、質問の有効性に関する人間の判断と強い整合性を示している。

ABSTRACT

Asking effective questions is a powerful social skill. In this paper we seek to build computational models that learn to discriminate effective questions from ineffective ones. Armed with such a capability, future advanced systems can evaluate the quality of questions and provide suggestions for effective question wording. We create a large-scale, real-world dataset that contains over 400,000 questions collected from Reddit "Ask Me Anything" threads. Each thread resembles an online press conference where questions compete with each other for attention from the host. This dataset enables the development of a class of computational models for predicting whether a question will be answered. We develop a new convolutional neural network architecture with variable-length context and demonstrate the efficacy of the model by comparing it with state-of-the-art baselines and human judges.

研究の動機と目的

  • 現実世界のオンラインQ&A環境における質問の有効性を自動的に評価できる計算モデルの開発。
  • 質問の表現方法や文脈が、AMAホストがその質問に答えるかどうかに影響を与えるかどうかの調査。
  • コミュニティ主導のQ&Aフォーラムにおける質問の回答可能性を研究するための大規模で現実世界のデータセットの構築。
  • 機械による予測と人間の判断、AMAホストの行動を比較し、モデルの性能と整合性を評価。
  • 特定の質問が回答されやすい要因(意味的、文法的、トピック的特徴など)の同定と探求。

提案手法

  • RedditのAMAスレッドから40万件の質問を含む大規模なデータセットを構築し、スレッドのタイトル、ホストの自己紹介、ユーザーの質問を含めた。
  • 可変長の文脈を処理できる新しい文脈に配慮したCNNアーキテクチャを設計し、1~5-gramの複数のn-gramフィルターウィンドウを用い、フィルターカウントを変化させた。
  • 局所的および分散型の意味的パターンを捉えるために、ユニグラム、ビグラム、トライグラム、および高次n-gram特徴を組み合わせてモデルを訓練した。
  • 1万件の検証セットを用いてモデルの性能を評価し、最先端のベースラインと人間のアノテーターとを比較した。
  • Amazon Mechanical Turkを用いた人間評価スタディを実施し、5名のアノテーターが同じAMAスレッドからの300組の質問ペアを評価し、好みと合意度を測定した。
  • 人間アノテーターの多数決を人間判断の代理として用い、モデルの予測を人間の判断とホストの行動の両者と比較した。

実験結果

リサーチクエスチョン

  • RQ1どのような質問の特徴がAMAホストがその質問に答える可能性を高めるか?
  • RQ2深層学習モデルは、質問の表現と文脈に基づいて、どの質問が答えられるかを効果的に予測できるか?
  • RQ3人間の判断における質問の有効性は、実際にAMAホストが選択する質問とどの程度整合しているか?
  • RQ4モデルの予測性能は、人間の合意度とホストの行動のどちらに近いか?
  • RQ5トレーニングデータのサイズが、質問回答可能性予測モデルの一般化性能と安定性に与える影響はいかほどか?

主な発見

  • 文脈に配慮したCNNモデルは、1万件の検証セットで53.7%のF1スコアを達成し、個別のベースラインCNNモデルや最先端手法を上回った。
  • 300フィルターと1語のウィンドウで最も高い性能を示し、予測にユニグラム特徴に強く依存していることが示された。
  • 人間アノテーターは63%の質問ペア(5人中4人以上が一致)で合意に達したが、完全な合意(全員一致)は30%にとどまった。
  • 人間アノテーターはAMAホストの選択と55%の一致を示したが、モデルは人間判断との一致度(54.33%)がホストの行動との一致度(49.33%)を上回った。
  • 大学学部生は人間アノテーターと68.6%の一致を示し、モデルがホストの行動と一致する度合い(49.33%)を上回った。
  • トレーニングデータ量の増加に伴い、モデルの性能は着実に向上し、10万件のトレーニングサンプルで53.7%のF1スコアがピークに達した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。