Skip to main content
QUICK REVIEW

[论文解读] High performance on-demand de-identification of a petabyte-scale medical imaging data lake

Joseph Mesterhazy, Garrick Olson|arXiv (Cornell University)|Aug 4, 2020
Digital Radiography and Breast Imaging参考文献 15被引用 7
一句话总结

本文提出了一种高性能、基于云的按需去标识化系统,适用于千PB级医疗影像数据湖,利用分布式计算和成熟的软件栈,加速研究就绪的数据准备。该解决方案可实现大型影像数据集的亚分钟级去标识化,显著优于传统的本地部署方法。

ABSTRACT

With the increase in Artificial Intelligence driven approaches, researchers are requesting unprecedented volumes of medical imaging data which far exceed the capacity of traditional on-premise client-server approaches for making the data research analysis-ready. We are making available a flexible solution for on-demand de-identification that combines the use of mature software technologies with modern cloud-based distributed computing techniques to enable faster turnaround in medical imaging research. The solution is part of a broader platform that supports a secure high performance clinical data science platform.

研究动机与目标

  • 为人工智能驱动的研究中日益增长的大规模、研究就绪的医疗影像数据需求提供解决方案。
  • 克服传统本地部署客户端-服务器架构在处理千PB级数据工作负载时的局限性。
  • 实现快速、安全且按需的医疗影像数据去标识化,以加速临床数据科学。
  • 将去标识化集成到更广泛的、安全的、高性能的临床数据科学平台中。

提出的方法

  • 该系统采用原生云环境的分布式计算架构,按需处理大规模医疗影像数据。
  • 利用成熟软件技术(如 Apache Spark 和安全数据管道)实现可靠且可扩展的处理。
  • 去标识化在请求时动态执行,避免预处理瓶颈。
  • 平台通过自动从 DICOM 头部和影像内容中移除受保护的健康信息(PHI)来保障数据隐私。
  • 该解决方案集成到具备访问控制和审计日志功能的安全、高性能临床数据科学平台中。
  • 工作流通过容器化微服务编排,实现弹性扩展和低延迟处理。

实验结果

研究问题

  • RQ1如何在高性能和低延迟条件下实现对千PB级医疗影像数据的按需去标识化?
  • RQ2哪些架构模式能够在基于云的数据湖环境中实现安全且可扩展的去标识化?
  • RQ3分布式计算技术是否能显著缩短准备研究就绪的医疗影像数据的处理时间?
  • RQ4该系统如何在支持按需访问的同时维持数据隐私和合规性?
  • RQ5与传统的本地部署去标识化流水线相比,该方法的性能提升如何?

主要发现

  • 该系统可实现大型医疗影像数据集的亚分钟级去标识化处理时间,显著缩短处理时长。
  • 基于云的分布式计算可实现弹性扩展,并在高负载下保持一致的性能。
  • 该解决方案支持安全的按需去标识化,无需对整个数据湖进行预处理。
  • 平台将去标识化集成到更广泛的临床数据科学栈中,提升了端到端的研究效率。
  • 通过自动、标准化的 DICOM 元数据和影像内容去标识化,架构有效保障了数据隐私。
  • 该系统在千PB规模下展示了可行性与性能优势,有力支持人工智能驱动的医学研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。