Skip to main content
QUICK REVIEW

[論文レビュー] Identifying leading indicators of product recalls from online reviews using positive unlabeled learning and domain adaptation

Shreesh Kumara Bhat, Aron Culotta|arXiv (Cornell University)|Mar 1, 2017
Sentiment Analysis and Opinion Mining被引用数 5
ひとこと要約

本論文は、CPSCの消費者苦情をポジティブシグナルとして用いることで、アマゾン製品レビューにおける安全上の危険要因を特定するためのポジティブ・アンラベルド学習およびドメイン適応フレームワークを提案する。このシステムはベースライン比でF1スコア8%の向上を達成し、回収製品の45%で公式リコールより数か月も前に対象の危険報告を検出でき、消費者および規制当局に対する早期警告を可能にする。

ABSTRACT

Consumer protection agencies are charged with safeguarding the public from hazardous products, but the thousands of products under their jurisdiction make it challenging to identify and respond to consumer complaints quickly. From the consumer's perspective, online reviews can provide evidence of product defects, but manually sifting through hundreds of reviews is not always feasible. In this paper, we propose a system to mine Amazon.com reviews to identify products that may pose safety or health hazards. Since labeled data for this task are scarce, our approach combines positive unlabeled learning with domain adaptation to train a classifier from consumer complaints submitted to the U.S. Consumer Product Safety Commission. On a validation set of manually annotated Amazon product reviews, we find that our approach results in an absolute F1 score improvement of 8% over the best competing baseline. Furthermore, we apply the classifier to Amazon reviews of known recalled products; the classifier identifies reviews reporting safety hazards prior to the recall date for 45% of the products. This suggests that the system may be able to provide an early warning system to alert consumers to hazardous products before an official recall is announced.

研究の動機と目的

  • 手動アノテーションを必要とせずに、消費者製品レビューにおける健康および安全上の危険要因をスケーラブルかつ自動的に検出するためのシステムを開発すること。
  • CPSCの苦情とアマゾンレビューの間のデータ不足およびドメインシフト問題に対処するため、ポジティブ・アンラベルド学習とドメイン適応を組み合わせること。
  • 公式リコールより前にオンラインレビューに現れる警告サインを特定することで、製品の危険要因を早期に検出すること。
  • 消費者保護機関が危険な製品をより効率的にスクリーニング、発見、お知らせするのを支援すること。

提案手法

  • 訓練用に、SaferProducts.govから取得した2,010件のCPSC苦情をポジティブインスタンスとして活用する。
  • 100,000件を超えるアノテーションなしのアマゾンレビューを、ポジティブ・アンラベルド学習の文脈におけるネガティブ/未知インスタンスとして使用する。
  • CPSC苦情の表現とアマゾンレビューの表現との間の分布シフトを軽減するためにドメイン適応を適用する。
  • データセットのシフトを考慮した修正された学習アルゴリズムを用いてテキスト分類器を訓練し、ドメイン間での一般化を向上させる。
  • 手動アノテート済みのアマゾンレビューのセットおよび歴史的リコール製品を用いて性能を検証する。
  • 時系列解析を用いて、危険信号が公式リコール日より前に対象となるかを評価する。

実験結果

リサーチクエスチョン

  • RQ1CPSC苦情を用いて訓練した分類器は、アマゾンレビューにおける安全上の危険要因を高い正確性と再現率で検出できるか?
  • RQ2訓練データとテストデータの言語的スタイルやドメインが異なる状況下で、ドメイン適応が分類器の性能をどの程度向上させるか?
  • RQ3アマゾンレビューにおける危険信号は、公式リコールより著しく前もって現れる可能性があるか?
  • RQ4キーワードベースの手法や標準的な教師ありベースラインと比較して、提案手法は安全上の危険要因の特定においてどの程度有効か?

主な発見

  • 提案手法はF1スコア84%を達成し、最高の競合ベースライン比で絶対値8%の向上を示した。
  • 回収製品の45%において、システムは公式リコール日より前に安全上の危険を報告するレビューを検出できた。
  • 分類器は平均してリコール発表より121日前に危険報告を特定した。これは強力な早期警告の可能性を示している。
  • キーワードベースのアプローチは、正確性が低く(9–44%)かつ用語の手動キュレーションを要するため、本手法に劣っていた。
  • ドメイン適応技術により、CPSC苦情とアマゾンレビューの間の分布シフトに起因する性能低下が顕著に低減された。
  • 本手法により、アマゾンレビューの手動ラベル付けを一切行わず、スケーラブルで低コストな安全上の危険要因の検出が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。