[論文レビュー] QDEE: Question Difficulty and Expertise Estimation in Community Question Answering Sites
本稿では、競合グラフモデルと社会的苦悩(social agony)を用いて階層的専門知識の成長を捉えることで、言語に依存しないフレームワークQDEEを提案する。ユーザーの進化する質問投稿パターンとテキスト特徴量を活用することで、コールドスタートにおける難易度推定と質問ルーティングを改善し、ルーティング精度のヒットレートが最大45%に達する。これは最先端手法を上回る性能を示している。
In this paper, we present a framework for Question Difficulty and Expertise Estimation (QDEE) in Community Question Answering sites (CQAs) such as Yahoo! Answers and Stack Overflow, which tackles a fundamental challenge in crowdsourcing: how to appropriately route and assign questions to users with the suitable expertise. This problem domain has been the subject of much research and includes both language-agnostic as well as language conscious solutions. We bring to bear a key language-agnostic insight: that users gain expertise and therefore tend to ask as well as answer more difficult questions over time. We use this insight within the popular competition (directed) graph model to estimate question difficulty and user expertise by identifying key hierarchical structure within said model. An important and novel contribution here is the application of "social agony" to this problem domain. Difficulty levels of newly posted questions (the cold-start problem) are estimated by using our QDEE framework and additional textual features. We also propose a model to route newly posted questions to appropriate users based on the difficulty level of the question and the expertise of the user. Extensive experiments on real world CQAs such as Yahoo! Answers and Stack Overflow data demonstrate the improved efficacy of our approach over contemporary state-of-the-art models. The QDEE framework also allows us to characterize user expertise in novel ways by identifying interesting patterns and roles played by different users in such CQAs.
研究の動機と目的
- コミュニティ質問応答(CQA)プラットフォームにおける、質問を適切なスキルを持つユーザーにルーティングする課題に対処すること。
- ユーザーの専門知識の進化とテキスト特徴量を用いて、新規に投稿された質問の難易度(コールドスタート問題)を推定すること。
- 有向競合グラフにおいて、ユーザーの専門知識と質問の難易度を階層的構造としてモデル化すること。
- 質問の難易度とユーザーの専門知識レベルをマッチングさせることで、質問ルーティングを改善すること。
- 難易度レベルごとのヒストグラムとクラスタリングを用いて、ユーザーの回答行動パターンを特徴付けること。
提案手法
- エッジが低い難易度/専門知識から高い難易度/専門知識への進行を表す有向競合グラフとして、ユーザーの専門知識と質問の難易度をモデル化する。
- 競合グラフにおける階層的違反に対するペナルティ指標として社会的苦悩を適用し、難易度と専門知識の推定を最適化する。
- 専門知識の増加仮説(EGA)を用い、ユーザーが時間経過とともにより難しい質問を投稿・回答する傾向があることから、単調な進行が生じると仮定する。
- テキスト特徴量(例:タイトル、本文、タグ)を組み合わせたハイブリッドモデルを用いて、新規質問の難易度を推定する。
- 回答済み質問の難易度のヒストグラム表現(ビンサイズ=3:簡単、中程度、困難)を用いてユーザーのプロフィールを構築し、行動パターンを特定する。
- ヒストグラム表現を用いてk-meansによるクラスタリングを実施し、回答の好みに基づいてユーザーのタイプ(例:オオカノジョウ、スズメ)を同定する。
実験結果
リサーチクエスチョン
- RQ1CQAにおいて、言語に依存しない形で質問の難易度とユーザーの専門知識を同時に推定する方法は何か?
- RQ2ユーザーの専門知識が時間経過とともに単調に向上するという特徴を活用することで、難易度推定とルーティングの性能は向上するか?
- RQ3社会的苦悩は、CQAプラットフォームにおける競合グラフの階層的構造をモデル化するのにどの程度有効か?
- RQ4テキスト特徴量と推定された難易度は、コールドスタートにおける難易度推定をどの程度改善するか?
- RQ5回答行動と難易度の好みに基づいて、CQAプラットフォームにおける代表的なユーザーのタイプ(アーキタイプ)は何か?
主な発見
- QDEEフレームワークは、新規に投稿された質問を適切なユーザーにルーティングする際、最大45%のヒットレートを達成し、ベースライン手法を著しく上回る。
- 言語に依存するモデル(例:QT)は言語に依存しないアプローチを上回るが、QDEEのハイブリッドな言語に依存しないアプローチとテキスト特徴量の組み合わせは依然として非常に有効である。
- 質問の難易度とユーザーの専門知識レベルをマッチングさせるQベースのルーティング戦略は、レピュテーションや専門知識のみに依存する戦略を上回り、中級層の専門家を効果的に動員する。
- QTモデルのパラメータβは、0.6〜0.8の範囲に設定された際に最も効果的であり、テキスト特徴量と難易度特徴量の最適なバランスを示している。
- Stack Overflowのユーザーのうち、3%〜10%しか「オオカノジョウ」として分類されない——つまり、難しい質問を好むユーザーは非常に少数であり、大多数のユーザーはレピュテーション獲得を目的に簡単な質問に集中している。
- ユーザーのヒストグラムプロフィールのクラスタリングにより、焦点を当てた専門家、全般的な回答者、初心者といった明確な行動タイプが明らかになった。これは、多様な回答の好みが存在することを裏付けている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。