Skip to main content
QUICK REVIEW

[論文レビュー] I call BS: Fraud Detection in Crowdfunding Campaigns

Beatrice Perez, Sara Machado|arXiv (Cornell University)|Jun 30, 2020
FinTech, Crowdfunding, Digital Finance被引用数 4
ひとこと要約

本論文では、寄付型クラウドファンディングキャンペーンの発表時における不正検出を、キャンペーンの説明文および画像からのテキスト特徴量と視覚的特徴量のみを用いて行う機械学習フレームワークを提案する。700件の健康関連キャンペーンからなる手動アノテーション済みデータセットを用いてアンサンブル分類器を学習した結果、AUCが96.01%、精度が91.14%に達し、ブラウザ内プラグインやプラットフォーム管理システムにおけるリアルタイムの不正検出が可能となる。

ABSTRACT

Donations to charity-based crowdfunding environments have been on the rise in the last few years. Unsurprisingly, deception and fraud in such platforms have also increased, but have not been thoroughly studied to understand what characteristics can expose such behavior and allow its automatic detection and blocking. Indeed, crowdfunding platforms are the only ones typically performing oversight for the campaigns launched in each service. However, they are not properly incentivized to combat fraud among users and the campaigns they launch: on the one hand, a platform's revenue is directly proportional to the number of transactions performed (since the platform charges a fixed amount per donation); on the other hand, if a platform is transparent with respect to how much fraud it has, it may discourage potential donors from participating. In this paper, we take the first step in studying fraud in crowdfunding campaigns. We analyze data collected from different crowdfunding platforms, and annotate 700 campaigns as fraud or not. We compute various textual and image-based features and study their distributions and how they associate with campaign fraud. Using these attributes, we build machine learning classifiers, and show that it is possible to automatically classify such fraudulent behavior with up to 90.14% accuracy and 96.01% AUC, only using features available from the campaign's description at the moment of publication (i.e., with no user or money activity), making our method applicable for real-time operation on a user browser.

研究の動機と目的

  • 寄付型クラウドファンディングキャンペーンにおける健康関連の不正キャンペーンの特徴を調査すること。
  • GoFundMe や Indiegogo などの主要プラットフォームから、700件のアノテート済みキャンペーン(不正 vs. 非不正)のデータセットを構築すること。
  • ユーザー行動や取引データを必要とせず、キャンペーン発表時点で入手可能な特徴量のみを用いて不正を検出する機械学習分類器を開発すること。
  • テキスト特徴量と視覚的特徴量を統合することで、人間の判断能力を上回る不正検出性能が得られるかどうかを評価すること。
  • ブラウザプラグインやプラットフォーム側スクリーニングシステムなどのデプロイ可能なツールを介して、リアルタイムで予防的不正検出を可能にすること。

提案手法

  • GoFundMe、MightyCause、Fundly、Fundrazr、Indiegogo から、医療および緊急支援を目的としたキャンペーンを対象に、700件のクラウドファンディングキャンペーンを収集・アノテートした。
  • 感情分析、読みやすさ、欺瞞に関連する言語的兆候など、自然言語処理(NLP)技術を用いてテキスト特徴量を抽出した。
  • コンピュータビジョンおよびディープラーニングモデルを用いて、改ざん済みまたは一般的なストック写真の使用など、異常を検出する画像特徴量を抽出した。
  • テキスト特徴量と視覚的特徴量を統合し、各キャンペーンごとに統一された特徴量ベクトルを作成した。
  • 統合された特徴量セットを用いて、アンサンブル機械学習分類器(例:XGBoost または類似手法)を学習し、発表時における不正状態を予測した。
  • 標準指標(AUC、精度、再現率、正答率)を用いてモデル性能を評価した。特にリアルタイム適用可能性に注目した。

実験結果

リサーチクエスチョン

  • RQ1発表時における不正なクラウドファンディングキャンペーンと正当なキャンペーンを区別するテキスト的および視覚的特徴は何か?
  • RQ2発表前の特徴量に基づいて学習された機械学習モデルは、人間の判断能力を上回る精度で不正を検出できるか?
  • RQ3自然言語処理(NLP)と画像処理の統合は、寄付型クラウドファンディングキャンペーンにおける欺瞞性の検出にどの程度効果的か?
  • RQ4このようなシステムは、ブラウザプラグインやプラットフォームレベルのフィルタとして、どの程度リアルタイムでデプロイ可能か?
  • RQ5アノテーションおよびモデル学習プロセスにおける主なバイアス要因は何か。それらはどのように軽減できるか?

主な発見

  • 提案されたモデルは、発表前のテキストおよび画像特徴量のみを用いて、不正キャンペーンの検出において最大で96.01%のAUCを達成した。
  • 分類器は91.14%の精度と90.77%の再現率を達成し、人間の欺瞞検出能力(約41%の改善)を著しく上回った。
  • 感情表現、読みやすさ、言語的欺瞞の兆候といったテキスト特徴量は、不正の強力な予測要因であることが分かった。
  • 一般的なストック写真の使用など、画像由来の特徴量は、不正キャンペーンと強く相関していた。
  • モデルの性能は、キャンペーン作成直後の不正検出が可能であることを示しており、予防的対応が実現可能であることを裏付けた。
  • 本研究では、不正行為がクラウドファンディングエコシステム全体のわずかだが影響力のある割合を占めており、年間数百万ドルの損失が発生する可能性があることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。