[论文解读] Report of the DOE/NSF Workshop on Correctness in Scientific Computing, June 2023, Orlando, FL
本报告综合了2023年DOE/NSF科学计算正确性研讨会(CSC'23)的发现,识别出由于硬件异构性、数值近似、机器学习集成以及代码级优化所导致的高性能计算(HPC)中的关键正确性挑战。报告提出了一套多学科框架,结合形式化方法、经验证的编译器、静态分析以及端到端案例研究,以确保HPC全栈的正确性,重点推荐为AI生成代码设置安全护栏并实施可复现性检查。
This report is a digest of the DOE/NSF Workshop on Correctness in Scientific Computing (CSC'23) held on June 17, 2023, as part of the Federated Computing Research Conference (FCRC) 2023. CSC was conceived by DOE and NSF to address the growing concerns about correctness among those who employ computational methods to perform large-scale scientific simulations. These concerns have escalated, given the complexity, scale, and heterogeneity of today's HPC software and hardware. If correctness is not proactively addressed, there is the risk of producing flawed science on top of unacceptable productivity losses faced by computational scientists and engineers. HPC systems are beginning to include data-driven methods, including machine learning and surrogate models, and their impact on overall HPC system correctness was also felt urgent to discuss. Stakeholders of correctness in this space were identified to belong to several sub-disciplines of computer science; from computer architecture researchers who design special-purpose hardware that offers high energy efficiencies; numerical algorithm designers who develop efficient computational schemes based on reduced precision as well as reduced data movement; all the way to researchers in programming language and formal methods who seek methodologies for correct compilation and verification. To include attendees with such a diverse set of backgrounds, CSC was held during the Federated Computing Research Conference (FCRC) 2023.
研究动机与目标
- 应对由于HPC系统中的正确性问题导致的科学结果缺陷风险日益增加的问题,尤其是在硬件异构性加剧以及机器学习集成日益普遍的背景下。
- 识别HPC全栈中的关键正确性挑战,包括数值精度、并发性、压缩技术以及代理模型。
- 提出可操作的技术与系统性干预措施——如经验证的库、形式化验证和工具链——以提升科学软件的正确性。
- 通过案例研究和跨编程语言与领域的标准化正确性设计实践,推动端到端的正确性。
- 加强计算机科学各子领域的协作,统一科学计算中的正确性工作。
提出的方法
- 在FCRC 2023期间举办为期数日的研讨会,邀请来自学术界、国家实验室和产业界的55位专家,识别关键正确性挑战。
- 将正确性挑战划分为八个核心领域:规格说明、并发性、抽象机制、数值问题、压缩技术、代理模型、异构性以及互操作性。
- 评估并推荐六项核心技术:归纳验证、模型检测、静态分析、模糊测试、调试以及程序综合。
- 提出干预机会,如经验证的编译器、具备正确性意识的构建系统以及基于正确性设计的编程语言。
- 为AI生成代码集成安全护栏,特别是针对大语言模型(LLMs),并倡导在编译器中自动实施正确性检查。
- 强调使用守恒定律检查和集合一致性测试,特别是在使用降阶模型时,以验证仿真输出。
实验结果
研究问题
- RQ1形式化方法与经验证的编译技术如何扩展以满足现代HPC工作负载的正确性需求?
- RQ2硬件异构性与激进的优化技术引入了哪些最关键的正确性挑战?
- RQ3如何在不损害科学有效性的前提下管理数值精度与数据压缩?
- RQ4代理模型与机器学习组件在多大程度上会破坏仿真正确性,以及如何对其进行验证?
- RQ5如何通过案例研究在全栈范围内——从算法到硬件——证明端到端的正确性?
主要发现
- 硬件异构性与部分未充分文档化的库共同构成了重大的正确性风险,尤其是在采用激进优化时。
- 代码级近似(如精度选择)必须经过形式化证明,并整合进正确性论证中。
- 编译器必须自动插入正确性检查,尤其是在为减少数据移动而进行优化时。
- AI生成的代码需要安全护栏与形式化验证,以防止细微错误与非可移植性问题。
- 检查守恒定律并使用集合一致性测试是验证复杂仿真的有效策略。
- 端到端正确性案例研究对于统一并展示HPC全栈的正确性至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。