Skip to main content
QUICK REVIEW

[論文レビュー] Predicting Helpfulness of Online Reviews

Abdalraheem Alsmadi, Shadi AlZu’bi|arXiv (Cornell University)|Aug 23, 2020
Sentiment Analysis and Opinion Mining参考文献 21被引用数 4
ひとこと要約

本稿では、Amazonレビューのデータを用いて、教師あり、半教師あり、事前学習済みディープラーニングモデルを組み合わせたマルチ・アプローチの機械学習フレームワークを提案する。半教師ありRCNNにFastText埋め込みを適用し、ファインチューニングされたBERT/RoBERTaモデルが、従来の分類器を著しく上回ることを示している。半教師ありRCNNは88.75%の全体精度を達成し、教師ありRCNNより6%高い性能を示しており、BERTは86.16%の精度を記録した。

ABSTRACT

E-commerce dominates a large part of the world's economy with many websites dedicated to online selling products. The vast majority of e-commerce websites provide their customers with the ability to express their opinions about the products/services they purchase. These feedback in the form of reviews represent a rich source of information about the users' experiences and level of satisfaction, which is of great benefit to both the producer and the consumer. However, not all of these reviews are helpful/useful. The traditional way of determining the helpfulness of a review is through the feedback from human users. However, such a method does not necessarily cover all reviews. Moreover, it has many issues like bias, high cost, etc. Thus, there is a need to automate this process. This paper presents a set of machine learning (ML) models to predict the helpfulness online reviews. Mainly, three approaches are used: a supervised learning approach (using ML as well as deep learning (DL) models), a semi-supervised approach (that combines DL models with word embeddings), and pre-trained word embedding models that uses transfer learning (TL). The latter two approaches are among the unique aspects of this paper as they follow the recent trend of utilizing unlabeled text. The results show that the proposed DL approaches have superiority over the traditional existing ones. Moreover, the semi-supervised has a remarkable performance compared with the other ones.

研究の動機と目的

  • オンライン製品レビューの有用性を自動で予測し、高コストで偏りのある人為的投票に依存するのを減らす。
  • 未ラベルのレビュー・データが活用されない問題に対処し、半教師あり学習技術を統合する。
  • BERT や RoBERTa といった事前学習済み言語モデルが分類精度を向上させる有効性を評価する。
  • 標準化されたAmazonレビュー・データセット上で、従来の機械学習モデル、ディープラーニングアーキテクチャ、トランスファー学習アプローチを比較する。
  • eコマースプラットフォームが、消費者に最も有用なレビューのみを提示するためのスケーラブルで高精度なソリューションを提供する。

提案手法

  • ラベル付きAmazonレビュー・データを用いて、FastText、SVM、Bi-LSTM、CNN、RCNNの複数の分類器を用いた教師あり学習パイプラインを訓練した。
  • ラベル付きデータ(90k)と大規模な未ラベル付きデータ(490k)を活用する半教師ありRCNNモデルを実装し、汎化性能の向上を図った。
  • 半教師あり設定における特徴表現の向上を目的に、スキップグラムアーキテクチャを用いたFastText語彙埋め込みを採用した。
  • 同じAmazonレビュー・データセット上で、トランスファー学習を用いて事前学習済みトランスフォーマーモデルBERTとRoBERTaをファインチューニングし、エンドツーエンド分類を実現した。
  • 4つの製品カテゴリ(書籍、家電、CD&レコード、映画&テレビ)における精度を主指標として、全モデルの評価を実施した。
  • BERTの学習において、データ拡張と動的マスキングを適用し、文脈表現の質と耐性を向上させた。

実験結果

リサーチクエスチョン

  • RQ1RCNNのようなディープラーニングモデルは、オンラインレビューの有用性予測において、従来の機械学習分類器を上回ることができるか?
  • RQ2半教師あり学習を用いて大規模な未ラベル付きデータを統合することで、レビューの有用性予測モデルの性能が向上するか?
  • RQ3BERT や RoBERTa といった事前学習済み言語モデルは、ファインチューニング済みRCNN や他の分類器と比較して、予測精度をどの程度向上させるか?
  • RQ4異なる製品カテゴリにおいて、半教師ありRCNNの性能は、教師ありバージョンと比較してどの程度異なるか?
  • RQ5BERT や RoBERTa を用いたトランスファー学習は、Amazonレビューの有用性予測タスクで最先端の結果を達成できるか?

主な発見

  • 教師ありRCNNは従来の分類器の中で最高の精度を記録し、全体で83.25%の精度を達成した。これは、FastText(75.9%)、SVM(75.5%)、Bi-LSTM(79.12%)、CNN(82%)を上回った。
  • 半教師ありRCNNは、全カテゴリで教師ありRCNNより5~6パーセンテージポイントの性能向上を達成し、全体で88.75%の精度を記録した。
  • FastText埋め込みを用いた半教師ありRCNNは、書籍で87%、家電で86%、CD&レコードで92%、映画&テレビで90%の精度を達成し、教師ありバージョンを著しく上回った。
  • 事前学習済みモデルBERTとRoBERTaは、それぞれ86.16%および84.12%の全体精度を達成し、RCNN(83.25%)を含むすべての教師ありモデルを上回った。一部のカテゴリでは、半教師ありRCNNをも上回った。
  • BERTモデルは、書籍で86.3%、家電で85.16%、CD&レコードで87.7%、映画&テレビで85.5%の精度を記録し、多様な製品タイプにわたる優れた汎化性能を示した。
  • 結果から、未ラベル付きデータとトランスファー学習がモデル性能を顕著に向上させることを確認した。半教師ありRCNNとBERTモデルは、本データセットにおいて新たなベンチマークを樹立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。