[论文解读] FAIR for AI: An interdisciplinary and international community building perspective
本文提出了一种由社区驱动的跨学科框架,将FAIR原则(可查找性、可访问性、互操作性、可重用性)扩展至人工智能(AI)模型和数据集,倡导在科学领域实现标准化、可重用且可持续的AI。该框架提出了可操作的策略,包括FAIR就绪的数据基础设施、AI模型仓库,以及跨学科平台(如Garden Project),以实现在各领域中自动化、可复现且具有创新性的AI驱动发现。
A foundational set of findable, accessible, interoperable, and reusable (FAIR) principles were proposed in 2016 as prerequisites for proper data management and stewardship, with the goal of enabling the reusability of scholarly data. The principles were also meant to apply to other digital assets, at a high level, and over time, the FAIR guiding principles have been re-interpreted or extended to include the software, tools, algorithms, and workflows that produce data. FAIR principles are now being adapted in the context of AI models and datasets. Here, we present the perspectives, vision, and experiences of researchers from different countries, disciplines, and backgrounds who are leading the definition and adoption of FAIR principles in their communities of practice, and discuss outcomes that may result from pursuing and incentivizing FAIR AI research. The material for this report builds on the FAIR for AI Workshop held at Argonne National Laboratory on June 7, 2022.
研究动机与目标
- 建立一个统一的、领域无关的框架,将FAIR原则应用于AI模型和数据集,确保其长期可重用性和科学影响力。
- 应对科学AI研究中日益严峻的AI模型和数据不可复现以及缺乏标准化的挑战。
- 倡导将符合FAIR标准的AI开发工作视为学术生涯和资金决策中的合法且有价值的贡献。
- 通过集成的科学数据基础设施,实现对AI研究新颖性和可靠性的自动化验证与评估。
- 通过FAIR兼容平台(如Garden Project和Physiome Project)链接AI模型、数据集和计算资源,促进跨学科协作。
提出的方法
- 改编并扩展原始的FAIR原则(2016年)以涵盖AI模型、软件、工作流和数据集作为第一类科研对象。
- 利用现有的科学数据基础设施,自动化评估和验证同行评审出版物中AI结果的FAIR性。
- 开发用户友好的平台,将研究论文与AI模型、数据和软件相链接,实现FAIR性的量化评估和发现。
- 将FAIR AI模型与FAIR就绪的数据及高性能计算环境(云、超级计算)集成,以支持可扩展、可复现的AI工作流。
- 推动创建领域特定的AI模型花园,将材料科学、物理和化学等领域的AI模型与数据相链接,促进方法间的交叉融合。
- 通过在多样化、结构化的FAIR数据上进行多任务和多模态学习,推进基础AI模型的发展,实现广泛下游应用。
实验结果
研究问题
- RQ1如何有效将FAIR原则扩展至AI模型和数据集,以确保其长期可重用性和科学影响力?
- RQ2在学术和科研职业发展中,需要哪些制度和基础设施变革,以激励并认可符合FAIR标准的AI开发?
- RQ3如何利用科学数据基础设施实现对新型AI研究成果验证与评估的自动化?
- RQ4FAIR兼容平台(如Garden Project)在促进跨学科AI模型和数据重用方面发挥何种作用?
- RQ5FAIR原则在多大程度上可支持基于多样化、互操作数据集训练的通用型、基础AI模型的发展?
主要发现
- FAIR for AI倡议已推动开发出实用的、由社区驱动的框架,将FAIR原则从数据扩展至AI模型、软件和工作流。
- Garden Project和Physiome Project等平台成功将FAIR AI模型和数据集与可复现的、兼容云和HPC的科学工作流相链接。
- 符合FAIR标准的数据基础设施可实现对AI结果新颖性和可靠性的自动化评估,提升研究透明度与可信度。
- 在多样化、结构化的FAIR数据上训练的多模态和多任务AI模型——例如可同时预测40种材料特性的模型——证明了科学领域通用AI的可行性。
- 将FAIR原则整合进科研评估流程,可推动机构采纳并实现对符合FAIR标准的AI工作的职业认可。
- 跨学科、资助机构和机构之间的协同合作——以Bridge2AI项目为典范——可加速可持续、互操作的AI研究生态系统的建设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。