Skip to main content
QUICK REVIEW

[논문 리뷰] A network and machine learning approach to detect Value Added Tax fraud

Angelos Alexopoulos, Πέτρος Δελλαπόρτας|arXiv (Cornell University)|2021. 06. 26.
Imbalanced Data Classification Techniques인용 수 4
한 줄 요약

이 논문은 네트워크 과학과 확장 가능한 분류 알고리즘을 통합하여 B2B 거래 네트워크의 구조적 패턴을 분석함으로써 부가가치세(VAT) 사기 탐지를 위한 새로운 기계학습 프레임워크를 제안한다. 불가리아 VAT 데이터를 사용하여 기존의 네트워크 구조를 忽시하는 전통적 기법들보다 뚜렷이 뛰어난 성능을 보이며, 알려진 사기 사례의 약 50%를 탐지함으로써 대규모에서 자동으로 사전에 사기를 식별할 수 있도록 한다.

ABSTRACT

Value Added Tax (VAT) fraud erodes public revenue and puts legitimate businesses at a disadvantaged position thereby impacting inequality. Identifying and combating VAT fraud before it occurs is therefore important for welfare. This paper proposes flexible machine learning algorithms which detect fraudulent transactions, utilising the information provided by the complex VAT network structure of a large dimension. VAT fraud detection is implemented through a combination of a suitably constructed Laplacian matrix with classification algorithms that rely on scalable machine learning techniques. The method is implemented on the universe of Bulgarian VAT data and detects around 50 percent of the VAT fraud, outperforming well-known techniques that ignore the information provided by the network of VAT transactions. Importantly, the proposed methods are automated, and can be implemented following the taxpayers submission of their VAT returns. This allows tax revenue authorities to prevent large losses of tax revenues through performing early identification of fraud between business-to-business transactions within the VAT system.

연구 동기 및 목표

  • 사업자 간 거래 네트워크의 구조적 특성을 활용하여 자동화되고 확장 가능한 부가가치세(VAT) 사기 탐지 시스템을 개발한다.
  • 납세자 수준의 행동과 그룹 수준의 네트워크 패턴을 통합함으로써 기존 기법의 한계를 극복하고 사기 탐지 정확도를 향상시킨다.
  • 부가가치세 신고 제출 과정 중에 사기성 납세자를 조기에 식별하여 사전에 수익 손실을 방지한다.
  • 세무 당국이 최소한의 수동 개입으로 고위험 납세자를 우선 감사 대상으로 선정할 수 있는 실용적이고 구현 가능한 솔루션을 제공한다.
  • 사기의 시간적 변화와 동적 특성을 고려하여 향후 다층 네트워크 모델의 기반을 마련한다.

제안 방법

  • 사업자 간 거래 네트워크에서 라플라시안 행렬을 구성하여 기업 간의 구조적 관계를 표현한다.
  • 네트워크 라플라시안에서 파생된 특징과 개인 납세자 행동 특징을 기반으로 확장 가능한 기계학습 분류기(예: 랜덤 포레스트, 기울기 부스팅)를 적용한다.
  • 이중 단계 알고리즘을 사용한다: 알고리즘 1은 네트워크 및 행동 특징을 바탕으로 고위험 납세자를 식별한다; 알고리즘 2는 추가적인 통계적 필터링을 통해 순위를 정밀하게 조정한다.
  • 예측된 사기 확률에 따라 납세자를 순위 매기는 위험 목록 생성 메커니즘을 도입하여 세무 당국이 감사를 우선순위에 따라 선별할 수 있도록 한다.
  • 불가리아 국립세무국의 실제 데이터를 사용하여 성능을 검증하고, 기준 기법과의 탐지율을 비교한다.
  • 중심성, 군집도, 커뮤니티 구조와 같은 네트워크 구조적 특징을 통합하여 비정상적인 거래 패턴을 탐지한다.

실험 결과

연구 질문

  • RQ1B2B VAT 거래에서의 네트워크 구조는 납세자 개인의 행동을 넘어서 사기 탐지 성능을 향상시키는 데 어떻게 활용될 수 있는가?
  • RQ2네트워크 기반 특징에 기반한 기계학습 모델은 기존 기법보다 더 높은 비율의 실제 VAT 사기를 탐지할 수 있는가?
  • RQ3자동 분류를 통해 감사 대상으로 선정할 납세자를 선택할 때, 위양성 비율과 탐지율 사이의 최적의 트레이드오프는 무엇인가?
  • RQ4기계학습과 네트워크 과학의 통합은 대규모 세제 시스템에서 사기 탐지의 확장성과 자동화를 어떻게 향상시키는가?
  • RQ5제안된 방법은 수익 손실이 발생하기 전에 얼마나 높은 정도로 사기를 사전에 식별할 수 있는가?

주요 결과

  • 제안된 방법은 불가리아 데이터셋에서 알려진 VAT 사기 사례의 약 50%를 탐지하며, 네트워크 구조를 고려하지 않는 전통적 기법보다 뚜렷이 뛰어난 성능을 보인다.
  • 알고리즘 1은 알고리즘 2보다 분류 성능이 뛰어나며, 특히 새로운로 식별된 고위험 납세자를 최대한 탐지하면서 위양성 수를 최소화하는 데 유리하다.
  • 보고된 납세자 수를 200명에서 50명으로 줄임으로써 위양성 수를 최소화하였으며, 이 중 40명이 2017년 12월 기준 공식 위험 목록에 포함된 것으로 확인되었다.
  • 이 방법을 사용해 2,000명의 납세자를 감사 대상으로 보고할 경우 최대 140건의 고위험 사례를 식별할 수 있어 강력한 확장성과 예측 능력을 입증한다.
  • 이 방법은 VAT 신고 제출 시점에 자동으로 실시간 사기 탐지를 가능하게 하여 사전 감사를 지원한다.
  • 결과적으로 네트워크 기반 특징이 사기 탐지 성능을 크게 향상시키며, 거래 네트워크의 구조적 패턴의 가치를 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.