Skip to main content
QUICK REVIEW

[論文レビュー] A network and machine learning approach to detect Value Added Tax fraud

Angelos Alexopoulos, Πέτρος Δελλαπόρτας|arXiv (Cornell University)|Jun 26, 2021
Imbalanced Data Classification Techniques被引用数 4
ひとこと要約

本稿では、ネットワーク科学とスケーラブルな分類アルゴリズムを統合した新たな機械学習フレームワークを提案し、B2B取引ネットワークの構造的パターンを分析することで付加価値税(VAT)の不正を検出する。ブルガリアのVATデータを用いて、既知の不正事例の約50%を検出可能であり、ネットワーク構造を無視する従来の手法に比べ顕著に優れた性能を示し、大規模かつ自動化された早期不正特定を可能にする。

ABSTRACT

Value Added Tax (VAT) fraud erodes public revenue and puts legitimate businesses at a disadvantaged position thereby impacting inequality. Identifying and combating VAT fraud before it occurs is therefore important for welfare. This paper proposes flexible machine learning algorithms which detect fraudulent transactions, utilising the information provided by the complex VAT network structure of a large dimension. VAT fraud detection is implemented through a combination of a suitably constructed Laplacian matrix with classification algorithms that rely on scalable machine learning techniques. The method is implemented on the universe of Bulgarian VAT data and detects around 50 percent of the VAT fraud, outperforming well-known techniques that ignore the information provided by the network of VAT transactions. Importantly, the proposed methods are automated, and can be implemented following the taxpayers submission of their VAT returns. This allows tax revenue authorities to prevent large losses of tax revenues through performing early identification of fraud between business-to-business transactions within the VAT system.

研究の動機と目的

  • 付加価値税(VAT)の自動的でスケーラブルな不正検出システムを構築し、企業取引ネットワークの構造的特性を活用すること。
  • 納税者個別の行動とグループレベルのネットワークパターンを統合することで、従来手法の限界を克服し、不正検出の正確性を向上させること。
  • VAT還付申告プロセス中に不正納税者を早期に特定し、収益損失が発生する前に対処すること。
  • 税務当局が最小限の手動介入で、高リスク納税者を優先順位付けして監査を実施できる実用的で導入可能なソリューションを提供すること。
  • 不正の時間的・動的特性に対応するため、将来のマルチレイヤーネットワークモデルの基盤を提示すること。

提案手法

  • 企業間取引ネットワークのラプラシアン行列を構築し、企業間の構造的関係を符号化する。
  • ネットワークのラプラシアンから導出された特徴量と個々の納税者行動特徴量を用いて、スケーラブルな機械学習分類器(例:ランダムフォレスト、勾配ブースティング)を適用する。
  • 2段階のアルゴリズムを採用:アルゴリズム1はネットワークおよび行動特徴に基づき高リスク納税者を特定する。アルゴリズム2は追加の統計フィルタリングを用いて順位付けを精緻化する。
  • 予測された不正確率に基づき納税者をランク付けするリスクリスト生成メカニズムを採用し、監査の優先順位付けを可能にする。
  • ブルガリア国立納税庁の実データを用いて性能を検証し、ベースライン手法との不正検出率を比較する。
  • 中心性、クラスタリング、コミュニティ構造などのネットワークトポロジー特徴量を組み込み、異常な取引パターンを検出する。

実験結果

リサーチクエスチョン

  • RQ1B2B VAT取引におけるネットワーク構造は、個々の納税者行動を越えて不正検出をどのように向上させることができるか。
  • RQ2ネットワーク埋め込み特徴量を学習に用いた機械学習モデルは、従来の手法に比べ、より高い割合の実際のVAT不正を検出可能か。
  • RQ3自動分類を用いて監査対象を選定する際、偽陽性率と検出率の最適なトレードオフは何か。
  • RQ4ネットワーク科学と機械学習を統合することで、大規模な税制システムにおける不正検出のスケーラビリティと自動化はどのように向上するか。
  • RQ5提案手法は、収益損失が顕著に発生する前までに不正をどの程度早期に特定可能か。

主な発見

  • 提案手法はブルガリアデータセットにおいて、既知のVAT不正事例の約50%を検出可能であり、ネットワーク構造を無視する従来手法に比べ顕著に優れた性能を示す。
  • アルゴリズム1は、特に偽陽性を最小限に抑えつつ、新たに特定されたリスクの高い納税者を最大限に検出する点で、アルゴリズム2を上回る分類性能を達成する。
  • 報告対象納税者数を200人から50人に削減することで、偽陽性を低減でき、そのうち40人が2017年12月までに公式のリスクリストに登録された。
  • 2,000人の納税者を監査対象として報告することで、最大140件の高リスク事例を同定可能であり、強力なスケーラビリティと予測能力を示す。
  • 本手法により、VAT還付申告のタイミングで自動的かつリアルタイムな不正検出が可能となり、能動的監査を支援する。
  • 結果から、ネットワークベースの特徴量が不正検出を顕著に向上させることを示しており、取引ネットワークにおける構造的パターンの価値が浮き彫りになる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。