[論文レビュー] Sequence embeddings help to identify fraudulent cases in healthcare insurance
本稿では、医療保険請求の不正検出を向上させるために、医療保険請求に特化した深層学習ベースのシーケンス埋め込みを提案する。治療コードとICD診断を可変長のシーケンスとしてモデル化することで、最先端のモデルを上回り、SMOTEENNリサンプリングを用いることでAUC 0.8515を達成し、データの摂動に対して高い頑健性を示した。
Fraud causes substantial costs and losses for companies and clients in the finance and insurance industries. Examples are fraudulent credit card transactions or fraudulent claims. It has been estimated that roughly $10$ percent of the insurance industry's incurred losses and loss adjustment expenses each year stem from fraudulent claims. The rise and proliferation of digitization in finance and insurance have lead to big data sets, consisting in particular of text data, which can be used for fraud detection. In this paper, we propose architectures for text embeddings via deep learning, which help to improve the detection of fraudulent claims compared to other machine learning methods. We illustrate our methods using a data set from a large international health insurance company. The empirical results show that our approach outperforms other state-of-the-art methods and can help make the claims management process more efficient. As (unstructured) text data become increasingly available to economists and econometricians, our proposed methods will be valuable for many similar applications, particularly when variables have a large number of categories as is typical for example of the International Classification of Disease (ICD) codes in health economics and health services.
研究の動機と目的
- 電子的健康記録から得られる非構造的で高基数の請求データにおける不正保険請求の検出という課題に対処すること。
- 特にICD-10などの多数のカテゴリカルコードを含む、不均衡で可変長の請求データに対して、従来の機械学習手法の限界を克服すること。
- 医療治療と診断のシーケンスから意味的で低次元の埋め込みを学習するための深層学習アーキテクチャを開発すること。
- 実世界の保険請求データを用いて、正確でスケーラブルな不正検出を可能にすることで、請求管理の効率を向上させること。
- 金融および保険システムで一般的なデータ摂動および悪意のある攻撃に対して、モデルの信頼性を確保すること。
提案手法
- 医療コード(ICD-10、処置コード)の可変長シーケンスを密度の高いベクトル表現に埋め込むためのシーケンスモデリング技術を用いる。
- アテンション機構(例:SWEM-max)を備えた深層ニューラルネットワークを用いて、治療シーケンスを固定長の埋め込みに集約する。
- 学習済み埋め込みを勾配ブースティングモデルと統合し、エンドツーエンドの不正分類を実現する。
- 入力の摂動および悪意のある攻撃に対する頑健性を向上させるために、データ拡張および adversarial training を適用する。
- 不正請求が稀なため、クラス不均衡を解消するため、リサンプリング技術(SMOTEENN、ADASYN)を適用する。
- 性能比較のためのベースラインとしてTF-IDF特徴量を用い、勾配ブースティングと組み合わせて、提案された埋め込みベースのアプローチとの性能を評価する。
実験結果
リサーチクエスチョン
- RQ1従来の機械学習手法と比較して、深層学習によるシーケンス埋め込みは、医療保険請求における不正検出を改善できるか?
- RQ2異なるリサンプリング技術(例:SMOTEENN、ADASYN)は、極めて不均衡な請求データにおけるモデル性能にどのように影響するか?
- RQ3提案されたモデルは、治療シーケンスにおけるランダムおよび悪意のある摂動に対して、どの程度頑健か?
- RQ4学習済み埋め込みは、通常のTF-IDF表現と比較して、請求データ内の不正関連パターンをどの程度適切に捉えられるか?
- RQ5ICDコードのような高基数のカテゴリカル変数を含む実世界の請求データに対し、モデルは一般化可能か?
主な発見
- 提案されたシーケンス埋め込みモデルは、InstanceHardnessThresholdリサンプリング手法を用いることでAUC 0.8515を達成し、他の最先端手法を上回った。
- SWEM-maxモデルは悪意のある攻撃に対して顕著な性能低下(AUCの低下)を示し、悪意のある入力摂動に対して脆弱であることが判明した。
- ランダムな摂動(例:シーケンスの末尾に治療を追加)によるモデル性能の低下はわずかであり、ノイズに対して中程度の頑健性を示した。
- TF-IDF特徴量と勾配ブースティングを組み合わせたモデルは、SWEMベースのモデルよりもランダムな破損に対してより高い安定性を示した。
- 本研究では、医療コードシーケンスに対する深層学習埋め込みが、実世界の保険データにおいて、古典的手法よりも不正検出の正確性を顕著に向上させることを確認した。
- 特に摂動付きの請求例を含む増強データの増加により、アーキテクチャの最適化とトレーニングデータ量の増加によって、モデル性能をさらなる向上が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。