[論文レビュー] Solving the "false positives" problem in fraud prediction
本論文では、Deep Feature Synthesis (DFS) を用いた自動特徴工学的手法を提案し、不正検出における誤検知を低減する。履歴データから1トランザクションあたり237個の行動特徴を生成し、誤検知を54%削減。185万件の未検査トランザクションにおいて19万ユーロのコスト削減を達成。特徴量の更新を35日ごとに行い、性能の低下を最小限に抑えながらも、高い性能を維持した。
In this paper, we present an automated feature engineering based approach to dramatically reduce false positives in fraud prediction. False positives plague the fraud prediction industry. It is estimated that only 1 in 5 declared as fraud are actually fraud and roughly 1 in every 6 customers have had a valid transaction declined in the past year. To address this problem, we use the Deep Feature Synthesis algorithm to automatically derive behavioral features based on the historical data of the card associated with a transaction. We generate 237 features (>100 behavioral patterns) for each transaction, and use a random forest to learn a classifier. We tested our machine learning model on data from a large multinational bank and compared it to their existing solution. On an unseen data of 1.852 million transactions, we were able to reduce the false positives by 54% and provide a savings of 190K euros. We also assess how to deploy this solution, and whether it necessitates streaming computation for real time scoring. We found that our solution can maintain similar benefits even when historical features are computed once every 7 days.
研究の動機と目的
- 不正検出における高い誤検知率という、長年の問題に取り組み、そのコストが不正そのものよりも高いことを理由に挙げている。
- 豊富な履歴取引データを活用し、既存の業界手法を上回る、透明性があり自動化された機械学習ソリューションを開発する。
- 24時間365日監視センターにおける高コストの人手による分析に依存するのを減らし、高度な特徴工学によるモデルの精度向上を図る。
- リアルタイムでの特徴計算が必須であるのか、それとも週単位や日単位の定期的更新で十分な性能が得られるのかを評価する。
- 大手多国籍銀行でのスケールでの高精度な不正検出モデルの導入が、財務的・運用的影響に与える影響を評価する。
提案手法
- 各カードの履歴取引データに基づき、Deep Feature Synthesis (DFS) を用いて237個の特徴量(100個以上の行動パターン)を自動生成する。
- 合計、平均、カウント、標準偏差、および時間的集約(例:取引間の平均時間)などの特徴プリミティブを用い、意味のある行動指標を導出する。
- 解釈可能性を確保しブラックボックスモデルを避けるために、導出された特徴量に基づいてランダムフォレスト分類器を訓練する。
- Featuretools ライブラリを用いた特徴近似を実装し、計算に遅延(例:7日、21日、35日)を設けることで計算コストを削減する。
- 適合率と再現率のバランスを取るために、モデルの意思決定閾値をチューニングする。特に高額取引に対しては、財務的成果を向上させるために別々にチューニングする。
- 精度、F1スコア、および誤検知ペナルティを含む総コストなどの指標を用いて、モデルのパフォーマンスを評価し、さまざまな近似間隔を比較する。
実験結果
リサーチクエスチョン
- RQ1リアルタイムでの特徴計算を必要とせずに、自動特徴工学により大規模な不正検出において誤検知率を顕著に低減できるか?
- RQ2特徴近似(例:7日、21日、35日ごとの更新)によって、モデルのパフォーマンスがどの程度低下するか。ただし、高い精度と再現率を維持できるか?
- RQ3高額取引が意思決定閾値に重み付けされる状況において、誤検知の低減が実世界の銀行環境に与える財務的影響は何か?
- RQ4豊富な履歴行動特徴に基づくモデルが、大手多国籍銀行が運用する既存のプロダクションシステムを上回る性能を示せるか?
- RQ5ストリーミング計算ではなく、定期的な特徴更新(例:週単位)で十分な性能が得られるか。これによりインfraコストが削減できるか?
主な発見
- 提案されたモデルは、185万2千件の未検査トランザクションのデータセットにおいて、誤検知を54%削減し、19万ユーロのコスト削減を達成した。
- 特徴量の計算を35日ごとに行っても、精度は0.236、F1スコアは0.373を維持し、日次更新と比較して顕著な性能低下は認められなかった。
- 高額取引を優先して閾値をチューニングした場合、真陽性率が≥0.89を達成し、精度は0.236を維持した。長期間の近似間隔であっても、精度に損なわれることなく、性能を維持した。
- 特徴量の更新を35日ごとに行った場合、誤検知のコストは約6万7千ユーロ上昇したが、モデルの優れた精度と運用負担の低減により、これを相殺した。
- 特徴近似を用いることで、特徴計算時間は67%短縮され、精度を損なわず、迅速なイテレーションとデプロイが可能になった。
- リアルタイムストリーミング計算が高精度な不正検出に必須ではないことが示された。週単位の定期的更新でも、強力なパフォーマンスを維持できることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。