Skip to main content
QUICK REVIEW

[论文解读] Serverless computing provides on-demand high performance computing for biomedical research

Dimitar Kumanov, Ling‐Hong Hung|arXiv (Cornell University)|Jul 31, 2018
Distributed and Parallel Computing Systems参考文献 13被引用 11
一句话总结

本文展示了使用 AWS Lambda 的无服务器计算可实现按需高性能计算,用于生物医学研究,通过动态分配资源而无需管理服务器。它实现了 250 倍的加速——在不到 1 美元的开销下,2 分钟内完成所有蛋白质对之间的两两比较,证明了其在大规模生物信息学工作负载中具有成本效益且可即时扩展。

ABSTRACT

Cloud computing offers on-demand, scalable computing and storage, and has become an essential resource for the analyses of big biomedical data. The usual approach to cloud computing requires users to reserve and provision virtual servers. An emerging alternative is to have the provider allocate machine resources dynamically. This type of serverless computing has tremendous potential for biomedical research in terms of ease-of-use, instantaneous scalability and cost effectiveness. In our proof of concept example, we demonstrate how serverless computing provides low cost access to hundreds of CPUs, on demand, with little or no setup. In particular, we illustrate that the all-against-all pairwise comparison among all unique human proteins can be accomplished in approximately 2 minutes, at a cost of less than $1, using Amazon Web Services Lambda. This is a 250x speedup compared to running the same task on a typical laptop computer.

研究动机与目标

  • 探索无服务器计算是否能够为生物医学数据分析提供可扩展、低成本且高性能的计算能力。
  • 解决传统云计算的局限性,例如服务器配置和管理的开销。
  • 证明在无服务器平台上运行计算密集型生物信息学工作负载(如所有蛋白质对之间的两两比较)的可行性。
  • 评估无服务器执行与传统笔记本电脑计算相比的性能和成本效率。
  • 提供一个概念验证,表明复杂的生物医学分析可在极少设置和动态资源分配下执行。

提出的方法

  • 使用 AWS Lambda(一种无服务器计算服务)执行并行化的生物信息学工作负载,无需管理底层基础设施。
  • 设计了一种分布式工作流,将人类蛋白质的所有对之间两两比较拆分为原子的、无状态的函数。
  • 利用事件驱动执行机制,按需触发单个比较任务,并自动扩展至数百个并发 CPU 实例。
  • 优化函数打包和输入/输出处理,以最小化无服务器环境中的延迟并最大化吞吐量。
  • 使用容器化执行环境,以确保与标准生物信息学工具的可重现性和兼容性。
  • 使用 AWS 计费和监控 API 测量执行时间和成本,以评估性能和经济效率。

实验结果

研究问题

  • RQ1无服务器计算能否在极少设置和管理的前提下,为生物医学数据分析提供高性能计算?
  • RQ2与在传统笔记本电脑上运行相比,无服务器执行在所有蛋白质对之间两两比较中的性能表现如何?
  • RQ3在无服务器平台(如 AWS Lambda)上运行大规模生物信息学工作负载的成本效率如何?
  • RQ4无服务器架构在多大程度上能够动态扩展以处理生物医学研究中的计算密集型任务?
  • RQ5无服务器计算能否实现快速、按需的复杂生物数据分析执行,而无需配置或管理服务器?

主要发现

  • 使用 AWS Lambda 完成对独特人类蛋白质的所有对之间两两比较耗时约 2 分钟。
  • 执行总成本低于 1 美元,与传统计算方法相比显著降低了成本。
  • 与在典型笔记本电脑上运行相同任务相比,性能实现了 250 倍的加速。
  • 无服务器计算实现了按需动态分配数百个 CPU,且无需手动配置服务器或进行设置。
  • 该系统展示了即时可扩展性以及近乎即时的资源可用性,非常适合生物医学研究中常见的突发性、不规则工作负载。
  • 结果证实,无服务器计算是生物信息学高性能计算的一种可行、高效且成本效益高的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。