Skip to main content
QUICK REVIEW

[論文レビュー] MASK: A flexible framework to facilitate de-identification of clinical texts

Nikola Milošević, Gangamma Kalappa|arXiv (Cornell University)|May 24, 2020
Topic Modeling参考文献 12被引用数 4
ひとこと要約

MASKは、カスタマイズ可能な名前付きエンティティ認識(NER)およびマスキング戦略を組み合わせることで、臨床テキストの脱識別化を可能にする柔軟でオープンソースのPythonフレームワークです。BiLSTMにELMoを組み合わせたCRFベースの手法を含む最先端のモデルをサポートし、i2b2 2014データセットにおいて名前でF1スコア0.98、全体で0.97を達成し、研究用途における脱識別化の速度と精度を顕著に向上させています。

ABSTRACT

Medical health records and clinical summaries contain a vast amount of important information in textual form that can help advancing research on treatments, drugs and public health. However, the majority of these information is not shared because they contain private information about patients, their families, or medical staff treating them. Regulations such as HIPPA in the US, PHIPPA in Canada and GDPR regulate the protection, processing and distribution of this information. In case this information is de-identified and personal information are replaced or redacted, they could be distributed to the research community. In this paper, we present MASK, a software package that is designed to perform the de-identification task. The software is able to perform named entity recognition using some of the state-of-the-art techniques and then mask or redact recognized entities. The user is able to select named entity recognition algorithm (currently implemented are two versions of CRF-based techniques and BiLSTM-based neural network with pre-trained GLoVe and ELMo embedding) and masking algorithm (e.g. shift dates, replace names/locations, totally redact entity).

研究の動機と目的

  • 臨床テキストの脱識別化の課題に取り組み、研究利用価値を保持すること。
  • 複数のNERおよびマスキングアルゴリズムをサポートするモジュラーで拡張可能なフレームワークを提供すること。
  • 50,000件のレコードに対して手作業による脱識別化に50万ドルを超える費用がかかる場合があることから、そのコストと時間を削減すること。
  • 研究者がエンティティタイプごとに最適なNERおよびマスキング手法を選択可能とすることで、精度とプライバシー準拠性を向上させること。
  • 新しいモデルやデータ形式に対応できる拡張性を備え、大規模な研究システムにライブラリまたはツールとして統合可能であること。

提案手法

  • MASKはプラグインベースのアーキテクチャを採用しており、交換可能な名前付きエンティティ認識(NER)およびマスキングアルゴリズムを可能としています。
  • 語彙的および辞書的特徴を用いた2つのCRFベースのNERモデル、および事前学習済みELMoとGLoVe埋め込みを用いた2つのBiLSTMベースのモデルをサポートしています。
  • NERモデルは、i2b2 2014およびICESプレミスデータを含む臨床テキストデータセット上で訓練または微調整されています。
  • マスキング戦略にはエンティティ置換、日付シフト、完全な削除が含まれ、エンティティタイプごとに構成可能です。
  • トレーニングおよび推論用のカスタマイズ可能なリーダープラグインにより、複数の入力フォーマットをサポートしています。
  • まずNERでPHI/PIIを検出するプロセスを経て、ユーザーが選択したマスキング手法を適用することで、エンドツーエンドの脱識別化を実現しています。

実験結果

リサーチクエスチョン

  • RQ1モジュラーなフレームワークは、モノリス型ツールと比較して、臨床テキストの脱識別化の精度と効率を向上させることができるか?
  • RQ2CRFベースとディープラーニングベースのNERモデルは、臨床の脱識別化タスクにおいてどのように性能を発揮するか?
  • RQ3臨床環境における異なるNERモデルにおいて、速度、精度、汎化性能のトレードオフはどのように変化するか?
  • RQ4事前学習済み埋め込みの微調整は、リソースが限られた臨床エンティティタイプの性能向上に寄与するか?
  • RQ5柔軟でプラグインベースのアーキテクチャは、多様な研究および臨床利用事例をどれほどサポートできるか?

主な発見

  • 残差接続を備えたBiLSTMモデルにELMo埋め込みを組み合わせたモデルが、i2b2 2014テストセットで全体のF1スコア0.97を達成し、最高の性能を示しました。
  • NAMEエンティティクラスではF1スコア0.98を記録し、人物名の認識において優れた性能を発揮しました。
  • 語彙的および辞書的特徴を用いたCRFモデルは、多くの先行システムを上回り、ディープラーニングモデルよりも顕著に高速でした。
  • GLoVe埋め込みを用いたBiLSTMモデルは、非臨床分野で事前学習された埋め込みが使用されたため、性能が低かったと考えられます。
  • ELMoベースのモデルはドメイン間での汎化性能が高く、適応に小さな微調整データセットで十分でした。
  • ELMoモデルの学習はCPU上で1エポックあたり約1時間、推論は1件のナラティブあたり最大10秒で実行可能でしたが、CRFモデルは1件あたり0.5秒未満で処理できました。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。