Skip to main content
QUICK REVIEW

[論文レビュー] Mining Compatible/Incompatible Entities from Question and Answering via Yes/No Answer Classification using Distant Label Expansion

Hu Xu, Lei Shu|arXiv (Cornell University)|Dec 14, 2016
Expert finding and Q&A systems参考文献 15被引用数 6
ひとこと要約

本稿では、人間によるアノテーションデータを一切用いずに、製品コミュニティ質疑応答(PCQA)における「はい/いいえ」質問から、互換性がある・ない製品を二段階フレームワークで抽出する手法を提案する。PU学習による遠隔ラベル拡張を用いて、明示的な答えとは異なる暗黙の「はい/いいえ」回答の極性を特定し、明示的答えを上回る互換性ラベル付けを実現。4つの製品において分類精度は約70%に達する。

ABSTRACT

Product Community Question Answering (PCQA) provides useful information about products and their features (aspects) that may not be well addressed by product descriptions and reviews. We observe that a product's compatibility issues with other products are frequently discussed in PCQA and such issues are more frequently addressed in accessories, i.e., via a yes/no question "Does this mouse work with windows 10?". In this paper, we address the problem of extracting compatible and incompatible products from yes/no questions in PCQA. This problem can naturally have a two-stage framework: first, we perform Complementary Entity (product) Recognition (CER) on yes/no questions; second, we identify the polarities of yes/no answers to assign the complementary entities a compatibility label (compatible, incompatible or unknown). We leverage an existing unsupervised method for the first stage and a 3-class classifier by combining a distant PU-learning method (learning from positive and unlabeled examples) together with a binary classifier for the second stage. The benefit of using distant PU-learning is that it can help to expand more implicit yes/no answers without using any human annotated data. We conduct experiments on 4 products to show that the proposed method is effective.

研究の動機と目的

  • 製品コミュニティ質疑応答(PCQA)における「はい/いいえ」QAペアから、互換性がある・ない製品を特定する課題に対処すること。互換性はしばしば「はい/いいえ」の質問で議論される。
  • 人間によるアノテーションデータに依存せずに、質問から補完的エンティティ(例:互換性があるデバイス)を抽出する手法を開発すること。
  • 「はい」「いいえ」または「ニュートラル」の極性を特定する。特に、明示的な「はい」や「いいえ」とは異なる暗黙の極性を同定すること。
  • 明示的な答えの開始語(「はい」「いいえ」)を用いた遠隔監視により、同じ極性を持つ類似した暗黙の答えを同定し、アノテーションコストを低減すること。
  • PU学習と二値分類を組み合わせることで、スケーラブルな互換性関係の抽出を可能にする、互換性ラベル付けの向上を図ること。

提案手法

  • 二段階フレームワーク:まず、補完的エンティティ抽出(CER)により、依存解析とルールベース手法を用いて質問からターゲットエンティティと補完的エンティティを抽出する。
  • 次に、yes/no回答分類により、回答の極性に基づいて互換性ラベル(互換性あり、互換性なし、不明)を付与する。
  • 遠隔ラベル拡張では、回答の先頭に「はい」「いいえ」があることを遠隔ラベルとして用い、同じ極性を持つ類似した暗黙の答えを同定する。
  • PU学習(Positive-Unlabeled)フレームワークを適用し、負例を必要とせず、未ラベルデータを活用して正例(「はい」「いいえ」回答)を拡張する。
  • 拡張された正例を用いて二値SVM分類器を学習し、「はい」と「いいえ」の極性を区別する。ニュートラルな回答はPU学習の枠組みで処理する。
  • CERの結果とPU学習に基づく回答分類を統合し、最終的な互換性ラベルを生成する。特徴量としてビグラムを用いる。

実験結果

リサーチクエスチョン

  • RQ1人間によるアノテーションデータなしで、PCQAにおける暗黙の「はい/いいえ」回答を効果的に同定できるか?
  • RQ2明示的な答えの開始語(「はい」「いいえ」)から得られる遠隔監視を、同じ極性を持つ暗黙の回答に拡張する方法は何か?
  • RQ3未ラベルの回答と明示的な正例を活用することで、PU学習が追加の互換性/非互換性エンティティを効果的に同定できるか?
  • RQ4提案手法は、回答極性分類および互換性関係抽出において、ベースライン手法と比較してどのように優れているか?
  • RQ5本フレームワークは、PCQAにおける明示的答え検出を上回って、どの程度互換性抽出を向上させられるか?

主な発見

  • 提案手法は、yes/no/neutralの回答分類において全体で約70%の精度を達成し、Yes/No、Sentiment Parser、One-Class SVMなどのベースラインを上回った。
  • PU学習は、未ラベルデータを活用することで、One-Class SVMよりも性能が著しく向上した。特に訓練データが少ない場合でも有効であった。
  • CER6K手法は、NPチャンカーやUIUC NERと比較して、PCQAにおける小文字のスペルミスをより適切に処理でき、最も高い精度と再現率を達成した。
  • センチメントパーサーのベースラインは、Yes/Noベースラインを下回った。特に否定的意見の処理において、感情分析のみで極性を捉える限界が顕著に現れた。
  • 3クラスSVMベースラインは、Yes/Noベースラインと比較してほとんど改善が見られず、McAuleyとYang(2016)の元の予測がもともとほとんどが明示的であったことが示唆された。
  • 本フレームワークは、遠隔監視を用いて暗黙の「はい/いいえ」回答を効果的に拡張し、人間によるアノテーションなしで追加の互換性関係を抽出できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。