Skip to main content
QUICK REVIEW

[논문 리뷰] Scraping and Preprocessing Commercial Auction Data for Fraud Classification

Ahmad A. Alzahrani, Samira Sadaoui|arXiv (Cornell University)|2018. 06. 02.
Auction Theory and Applications참고 문헌 9인용 수 11
한 줄 요약

이 논문은 실질적인 이베이 온라인 경매에서 iPhone 7의 경매 기록을 웹 스크래핑하고 철저한 전처리를 통해 수집한 대규모 고품질의 셀프입찰(SB) 패턴 데이터셋을 제시한다. 여덟 가지 SB 탐지 패턴을 적용하여 이상 징후가 있는 입찰자를 식별하였으며, 총 6,321개의 레이블이 부여된 인스턴스를 확보하였고, 기계학습 모델을 활용한 경매 사기 방지 연구를 위한 공개 가능하고 진정성 있는 데이터셋을 제공한다.

ABSTRACT

In the last three decades, we have seen a significant increase in trading goods and services through online auctions. However, this business created an attractive environment for malicious moneymakers who can commit different types of fraud activities, such as Shill Bidding (SB). The latter is predominant across many auctions but this type of fraud is difficult to detect due to its similarity to normal bidding behaviour. The unavailability of SB datasets makes the development of SB detection and classification models burdensome. Furthermore, to implement efficient SB detection models, we should produce SB data from actual auctions of commercial sites. In this study, we first scraped a large number of eBay auctions of a popular product. After preprocessing the raw auction data, we build a high-quality SB dataset based on the most reliable SB strategies. The aim of our research is to share the preprocessed auction dataset as well as the SB training (unlabelled) dataset, thereby researchers can apply various machine learning techniques by using authentic data of auctions and fraud.

연구 동기 및 목표

  • 기계학습 모델을 활용한 온라인 경매 사기 탐지 연구를 위한 진정성 있고 레이블이 부여된 셀프입찰(SB) 데이터셋의 부족 문제를 해결하기 위해.
  • 이베이와 같은 상업적 플랫폼에서 원시 경매 데이터를 추출하고 정제하며 전처리하는 재현 가능한 파이프라인을 개발하기 위해.
  • 입찰 시퀀스에서 유도된 여덟 가지 다른 행동 패턴을 기반으로 셀프입찰 행동을 식별하고 정량화하기 위해.
  • 실제 경매 데이터를 기반으로 신뢰할 수 있고 고품질의 SB 학습 데이터셋을 생성하여, 레이블이 부여된 인스턴스를 포함함으로써 강력한 사기 분류 연구를 가능하게 하기 위해.
  • 향후 연구를 지원하기 위해 전처리된 데이터셋과 SB 패턴을 학술 및 산업 응용 분야에서의 공개 사용을 위해 제공하기 위해.

제안 방법

  • 자동 스크립트를 사용해 iPhone 7s에 대한 807개의 이베이 경매를 웹 스크래핑하여 경매 및 입찰 수준의 데이터를 추출한다.
  • 입찰 시점, 입찰 비율, 경매 시작 가격 등의 속성을 정규화하기 위해 원시 경매 데이터를 전처리한다.
  • 여덟 가지 셀프입찰 탐지 패턴 정의 및 계산: 입찰자 성향, 조기 입찰, 입찰 비율, 최종 입찰, 경매 시작 가격, 연속적 초과입찰, 승리 비율, 경매 입찰 수.
  • 패턴 점수를 [0, 1] 범위로 정규화하여 일관성 확보 및 비활성 사용자로부터의 편향 제거.
  • 각 입찰자-경매 쌍에 대해 패턴 점수를 집계하여 10개의 특징 벡터(경매 ID, 입찰자 ID, 여덟 가지 패턴 점수)를 생성한다.
  • 이상치 검사를 통해 데이터셋을 검증하고, 모든 값이 [0, 1] 범위 내에 유지되었는지 확인하여 데이터 무결성 확보.

실험 결과

연구 질문

  • RQ1온라인 경매에서 셀프입찰자와 정상 입찰자를 구분하는 데 가장 신뢰할 수 있는 행동 패턴은 무엇인가?
  • RQ2실세계 경매 데이터는 어떻게 체계적으로 스크래핑하고 전처리하여 고정밀도의 사기 탐지 데이터셋을 만들 수 있는가?
  • RQ3실제 상업적 경매에서 일반적인 셀프입찰 행동—예를 들어 조기 입찰, 연속적 초과입찰, 마지막 순간 입찰—는 얼마나 자주 발생하는가?
  • RQ4기계학습 기반의 사기 탐지 연구를 지원하기 위해 실질적인 경매 행동을 기반으로 한 대규모 공개 데이터셋을 구축할 수 있는가?
  • RQ5실제 SB 데이터셋에서 정상 및 이상 입찰 행동 간의 불균형 문제는 어떻게 해결되어야 하며, 효과적인 모델 훈련을 위해 어떻게 대처할 수 있는가?

주요 결과

  • 최종 SB 데이터셋은 807개의 경매에서 총 6,321개의 인스턴스를 포함하며, 1,054명의 고유한 입찰자 ID를 보유하고 있어 다양한 입찰 행동의 포괄적이고 다양성 있는 샘플을 제공한다.
  • 26.25%의 입찰자가 승리하지 못한 채 공격적인 초과입찰 행동을 보였으며, 이는 셀프입찰 활동에 강력한 증거로 볼 수 있다.
  • 46.6%의 입찰자가 낮은 시작 가격을 가진 경매에 참여하여 경쟁 입찰을 유도하기 위한 전략적 접근을 취한 것으로 나타났다.
  • 31.26%의 입찰자가 경매의 마지막 단계까지 활동을 유보하여, 마지막 순간 입찰 조작과 일치하는 행동을 보였다.
  • 31.13%의 입찰자가 연속적 초과입찰을 반복적으로 보이며, 셀프입찰의 핵심적 지표로 작용하는 행동을 보였다.
  • 정규화된 패턴 점수에 이상치가 없었으며, 전처리 후 데이터 품질과 신뢰성이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.