[논문 리뷰] Detecting Transaction-based Tax Evasion Activities on Social Media Platforms Using Multi-modal Deep Neural Networks
이 논문은 인스타그램 게시물의 텍스트(코멘트, 해시태그)와 이미지 특징을 융합하여 소셜 미디어에서 거래 기반 탈세를 탐지하는 다중모달 딥 뉴럴 네트워크 Regtech 도구를 제안한다. 모델은 단일 모달리티 모델을 크게 능가하며 AUC 0.808과 F1 스코어 0.762를 달성하여 감사 효율성을 3배 이상 향상시켰다.
Social media platforms now serve billions of users by providing convenient means of communication, content sharing and even payment between different users. Due to such convenient and anarchic nature, they have also been used rampantly to promote and conduct business activities between unregistered market participants without paying taxes. Tax authorities worldwide face difficulties in regulating these hidden economy activities by traditional regulatory means. This paper presents a machine learning based Regtech tool for international tax authorities to detect transaction-based tax evasion activities on social media platforms. To build such a tool, we collected a dataset of 58,660 Instagram posts and manually labelled 2,081 sampled posts with multiple properties related to transaction-based tax evasion activities. Based on the dataset, we developed a multi-modal deep neural network to automatically detect suspicious posts. The proposed model combines comments, hashtags and image modalities to produce the final output. As shown by our experiments, the combined model achieved an AUC of 0.808 and F1 score of 0.762, outperforming any single modality models. This tool could help tax authorities to identify audit targets in an efficient and effective manner, and combat social e-commerce tax evasion in scale.
연구 동기 및 목표
- 국제 세무 당국이 소셜 미디어 플랫폼에서 은밀한 경제 활동을 탐지할 수 있도록 Regtech 도구를 개발하는 것.
- 거래 기반 탈세 징후를 위한 #립스틱 관련 58,660개의 인스타그램 게시물을 수집하고 수작업으로 레이블링한 데이터셋을 구축하는 것.
- 텍스트 및 시각적 특징을 통합하는 다중모달 딥 뉴럴 네트워크를 설계하여 의심스러운 게시물을 탐지하는 것.
- 단일 모달리티 기반 모델과의 성능 비교를 통해 탐지 효율성 향상을 입증하는 것.
- 감사 우선순위 설정을 위한 스케일러블하고 자동화된 잠재적 탈세 대상 식별을 가능하게 하는 것.
제안 방법
- 해시태그 #lipstick를 사용하여 58,660개의 인스타그램 게시물을 수집하고, 표본 2,081개를 수작업으로 다중 탈세 관련 속성에 따라 레이블링하였다.
- 코멘트(자연어 처리 임베딩), 해시태그(텍스트 특징), 이미지(CNN 기반 특징)의 세 가지 입력 모odal을 처리하는 모듈식 다중모달 딥 뉴럴 네트워크를 설계하였다.
- 고수준 의미적 특징을 추출하기 위해 최신 기술의 사전 학습된 모델(예: BERT 유사 모델, ResNet 등)을 활용하였다.
- 모든 세 가지 모달리티의 표현을 연결하여 최종 예측을 생성하는 후기 융합 방식으로 모달리티별 특징을 융합하였다.
- 이진 교차 엔트로피 손실을 사용하여 모델을 훈련하고, 보류된 테스트 세트에서 AUC 및 F1 스코어를 평가하였다.
- 영상 콘텐츠 처리를 위해 영상 클립을 무작위 노이즈 이미지로 대체하였지만, 이는 성능 저하를 초래하여 향후 영상 모달리티 통합의 필요성을 시사하였다.
실험 결과
연구 질문
- RQ1텍스트 및 이미지 특징을 활용하여 다중모달 딥 뉴럴 모델이 소셜 미디어 게시물에서 거래 기반 탈세를 효과적으로 탐지할 수 있는가?
- RQ2다중모달 모델의 성능은 텍스트 전용 또는 이미지 전용 단일 모달리티 모델과 비교해 어떻게 다른가?
- RQ3세무 당국이 무작위 샘플링을 사용할 때와 비교해 모델이 감사 효율성을 얼마나 향상시킬 수 있는가?
- RQ4각 모달리티(텍스트, 이미지, 해시태그)가 최종 탐지 성능에 기여하는 정도는 얼마이며, 상호 보완적인 역할은 어떻게 수행되는가?
- RQ5모델은 새로운 제품이나 영상 콘텐츠와 같은 새로운 모달리티를 포함한 탈세 활동을 탐지하기 위해 어떻게 확장될 수 있는가?
주요 결과
- 다중모달 모델은 AUC 0.808과 F1 스코어 0.762를 달성하여 어떤 단일 모달리티 모델보다도 유의미하게 뛰어난 성능을 보였다.
- 통합 모델은 100개의 추천된 의심스러운 게시물당 72건의 실제 탈세 활동을 식별하여, 무작위 샘플링 대비 감사 효율성 300% 이상 향상시켰다(무작위 샘플링 기준 22건/100건).
- 이미지 특징은 높은 정밀도를 기여했고, 텍스처 특징은 높은 재현율을 기여하여 서로 보완적인 강점을 보였다.
- 영상 클립을 무작위 노이즈 이미지로 대체한 경우 성능이 저하되어 향후 버전에서 전용 영상 처리 기능이 반드시 필요함을 시사하였다.
- 수작업으로 레이블링한 2,081개의 인스타그램 게시물 데이터셋은 향후 소셜 이커머스 및 은밀한 경제 탐지 연구를 위한 견고한 기반 자료가 되었다.
- 이 도구는 중국 국가세무국 및 호주 연방경찰의 관심을 끌었으며, 중국의 골든 텍스 프로젝트에 통합하고, 의료 마스크와 같은 다른 제품으로 확장할 계획이 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.