[论文解读] Extracting human interpretable structure-property relationships in chemistry using XAI and large language models
XpertAI 是一种新颖的框架,将可解释人工智能(XAI)与大型语言模型(LLMs)及科学文献相结合,生成人类可理解的、自然语言形式的化学结构-性质关系解释。通过结合 XAI 驱动的特征重要性与 LLM 生成的、具有科学依据的解释,XpertAI 在五个案例研究中提供了具体、易懂且准确的分子数据解释,展示了其弥合黑箱机器学习模型与非专家用户之间差距的能力。
Explainable Artificial Intelligence (XAI) is an emerging field in AI that aims to address the opaque nature of machine learning models. Furthermore, it has been shown that XAI can be used to extract input-output relationships, making them a useful tool in chemistry to understand structure-property relationships. However, one of the main limitations of XAI methods is that they are developed for technically oriented users. We propose the XpertAI framework that integrates XAI methods with large language models (LLMs) accessing scientific literature to generate accessible natural language explanations of raw chemical data automatically. We conducted 5 case studies to evaluate the performance of XpertAI. Our results show that XpertAI combines the strengths of LLMs and XAI tools in generating specific, scientific, and interpretable explanations.
研究动机与目标
- 通过生成结构-性质关系的可读解释,解决化学领域机器学习模型的不透明性问题。
- 克服传统 XAI 方法的局限性,后者通常技术性强,对非专家不友好。
- 利用大型语言模型(LLMs)将科学文献与 XAI 输出相结合,确保解释具有科学准确性并符合上下文语境。
- 开发一种可泛化、可适应的框架,能够为任何需要输入-输出关系解释的数据集生成定制化的自然语言解释。
- 通过提供具体、可解释且易访问的解释,提升实验与计算化学领域中机器学习模型的信任度与可用性。
提出的方法
- 使用分子描述符和 MACCS 键对分子数据进行特征工程,并通过 scikit-learn API 训练代理机器学习模型(XGBoost)
- 应用 XAI 方法(如 SHAP、LIME)识别对目标性质预测最具影响力的分子特征
- 利用微调后的 LLM,通过整合 XAI 识别的特征与科学文献中的证据,生成自然语言解释(NLEs)
- 通过将每条解释建立在数据集的独特特征和相关参考文献基础上,而非通用文献,确保解释的具体性
- 通过在溶解度、可燃性等化学性质上的案例研究验证解释,将 LLM 输出与领域专业知识进行对比
- 设计框架时注重模块化与可泛化性,使其适用于任何需要输入-输出关系解释的领域

实验结果
研究问题
- RQ1XAI 与 LLM 能否结合生成科学准确、人类可理解的化学结构-性质关系解释?
- RQ2如何引导 LLM 生成特定于数据集的解释,而非通用摘要?
- RQ3LLM 生成的解释在多大程度上与既定化学原理和科学文献一致?
- RQ4XAI 与 LLM 的整合能否提升非技术用户在化学领域对机器学习模型的信任度与可用性?
- RQ5哪些分子特征最能预测溶解度和可燃性等性质,其作用如何以自然语言形式清晰传达?
主要发现
- XpertAI 在五个不同的化学结构-性质关系上成功生成了具体、科学准确且可解释的自然语言解释,包括溶解度和上燃烧极限。
- 该框架生成的解释正确关联了分子特征(如 HOMO 能量、偶极矩和结构对称性)与目标性质,与已知化学原理一致。
- 解释基于科学文献,引用了相关研究(如 Yuan et al., 2019)以支持关于分子行为与反应性的主张。
- LLM 生成的解释表现出良好的适应性,内容根据 XAI 为每个数据集识别的特定特征进行定制,而非依赖通用模板。
- 通过案例研究及与仅使用 LLM 或仅使用 XAI 方法的对比,验证了 XpertAI 在可解释性、可及性与科学相关性方面的优越表现。
- 该框架具有可泛化性,在化学领域之外也具备潜在应用价值,适用于任何需要可解释输入-输出关系提取的领域。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。