Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Transaction-based Tax Evasion Activities on Social Media Platforms Using Multi-modal Deep Neural Networks

Lelin Zhang, Xi Nan|arXiv (Cornell University)|Jul 27, 2020
Taxation and Compliance Studies参考文献 20被引用数 5
ひとこと要約

本論文では、Instagram投稿を用いた取引ベースの脱税を検出するマルチモーダル深層ニューラルネットワークRegTechツールを提案する。テキスト(コメント、ハッシュタグ)と画像特徴を統合することで、AUC 0.808、F1スコア 0.762を達成し、単一モダリティモデルを著しく上回り、監査の効率を3倍以上向上させる。

ABSTRACT

Social media platforms now serve billions of users by providing convenient means of communication, content sharing and even payment between different users. Due to such convenient and anarchic nature, they have also been used rampantly to promote and conduct business activities between unregistered market participants without paying taxes. Tax authorities worldwide face difficulties in regulating these hidden economy activities by traditional regulatory means. This paper presents a machine learning based Regtech tool for international tax authorities to detect transaction-based tax evasion activities on social media platforms. To build such a tool, we collected a dataset of 58,660 Instagram posts and manually labelled 2,081 sampled posts with multiple properties related to transaction-based tax evasion activities. Based on the dataset, we developed a multi-modal deep neural network to automatically detect suspicious posts. The proposed model combines comments, hashtags and image modalities to produce the final output. As shown by our experiments, the combined model achieved an AUC of 0.808 and F1 score of 0.762, outperforming any single modality models. This tool could help tax authorities to identify audit targets in an efficient and effective manner, and combat social e-commerce tax evasion in scale.

研究の動機と目的

  • 国際的な租税当局がSNSプラットフォーム上での隠れた経済活動を検出できるRegTechツールの開発を目的とする。
  • 「#lipstick」というハッシュタグを用いて収集した58,660件のInstagram投稿から、取引ベースの脱税兆候を示す属性を複数手動ラベル付けしたデータセットの収集。
  • テキストおよび視覚的特徴を統合するマルチモーダル深層ニューラルネットワークの設計。
  • 単一モダリティベースラインと比較してモデルの性能を評価し、検出効率の向上を実証すること。
  • スケーラブルで自動化された手法により、監査優先対象の特定を可能にすること。

提案手法

  • ハッシュタグ「#lipstick」を用いて58,660件のInstagram投稿を収集し、そのうち2,081件をサンプリングして複数の脱税関連属性で手動ラベル付けした。
  • コメント(NLP埋め込み)、ハッシュタグ(テキスト特徴)、画像(CNNベースの特徴)の3つの入力モダリティを処理するモジュラーなマルチモーダル深層ニューラルネットワークを設計した。
  • テキスト(例:BERTに類似)および画像(例:ResNet)の最先端の事前学習モデルを用いて、高レベルの意味的特徴を抽出した。
  • 最終予測を、3つのモダリティの特徴表現を連結することで得る、ラテン統合手法を採用した。
  • バイナリクロスエントロピー損失を用いてモデルを学習し、ホールドアウトされたテストセット上でAUCおよびF1スコアを評価した。
  • 動画コンテンツについては、動画クリップをランダムなノイズ画像に置き換えたが、この処理により性能が低下したため、今後のバージョンで専用の動画処理機能の統合が不可欠であることが示唆された。

実験結果

リサーチクエスチョン

  • RQ1テキストおよび画像特徴を用いたマルチモーダル深層学習モデルは、SNS投稿における取引ベースの脱税を効果的に検出できるか?
  • RQ2マルチモーダルモデルの性能は、テキストのみまたは画像のみの単一モダリティモデルと比べてどのように異なるか?
  • RQ3税務当局がランダムサンプリングを用いる場合と比較して、このモデルは監査効率をどの程度向上できるか?
  • RQ4各モダリティ(テキスト、画像、ハッシュタグ)が最終的な検出性能にどの程度寄与しているか、またそれらがどのように補完し合うか?
  • RQ5本モデルは、未確認の製品や動画コンテンツなどの新しいモダリティを含む脱税行動を検出するために、どのように拡張できるか?

主な発見

  • マルチモーダルモデルはAUC 0.808、F1スコア 0.762を達成し、いかなる単一モダリティモデルよりも著しく優れていた。
  • 統合モデルは、100件の推奨された懸念事項のうち72件の実際の脱税活動を特定した。これは、ランダムサンプリング(100件あたり22件)と比較して監査効率が300%以上向上したことを示している。
  • 画像特徴は高い正確性(precision)を示した一方、テキスト的特徴は高い再現率(recall)を示し、モダリティ間の相補的な強みが明らかになった。
  • 動画クリップをランダムノイズ画像に置き換えた際、モデルの性能が低下したため、今後のバージョンで動画処理を専用に統合する必要があることが示された。
  • 2,081件の手動ラベル付け済みInstagram投稿からなるデータセットは、今後のSNS型ECおよび隠れた経済活動検出分野の研究における強固なベースラインを提供する。
  • 本ツールは中国の税務総局およびオーストラリア連邦警察から関心を示され、中国のゴールデン・タックス・プロジェクトへの統合が予定されており、医療用マスクなどの他の製品への展開も予定されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。