[论文解读] Entity Aware Modelling: A Survey
本综述提出了一种面向实体感知建模(EAM)的结构化框架,通过整合实体特异性特征(无论是显式提供还是从数据中推断得出),以提升在异质性、低数据场景下的个性化预测性能。该框架融合了多任务学习、元学习和表征学习的方法,并突出了其与公平性、不确定性量化以及知识引导型人工智能之间的新兴协同效应。
Personalized prediction of responses for individual entities caused by external drivers is vital across many disciplines. Recent machine learning (ML) advances have led to new state-of-the-art response prediction models. Models built at a population level often lead to sub-optimal performance in many personalized prediction settings due to heterogeneity in data across entities (tasks). In personalized prediction, the goal is to incorporate inherent characteristics of different entities to improve prediction performance. In this survey, we focus on the recent developments in the ML community for such entity-aware modeling approaches. ML algorithms often modulate the network using these entity characteristics when they are readily available. However, these entity characteristics are not readily available in many real-world scenarios, and different ML methods have been proposed to infer these characteristics from the data. In this survey, we have organized the current literature on entity-aware modeling based on the availability of these characteristics as well as the amount of training data. We highlight how recent innovations in other disciplines, such as uncertainty quantification, fairness, and knowledge-guided machine learning, can improve entity-aware modeling.
研究动机与目标
- 解决在个体实体对外部驱动因素响应存在异质性、且训练数据稀缺的低数据场景下,个性化预测的挑战。
- 基于实体特征的可获得性与每实体的训练数据量大小,系统性地组织现有实体感知建模(EAM)方法。
- 识别并整合跨学科创新(如不确定性量化、公平性、知识引导学习)至EAM,以提升模型的鲁棒性与可用性。
- 指出当前EAM方法的局限性,包括数据不平衡、测量偏差,以及在不同部署环境间泛化能力不足的问题。
- 为在水文、医疗和环境科学等领域的实际决策中推进EAM的发展,提供研究路线图。
提出的方法
- 将EAM方法划分为两个主要维度:(1) 显式实体特征的可用性(如土地覆盖、基因数据);(2) 每个实体的训练数据量(低 vs. 高)。
- 在缺乏显式特征时,利用元学习与表征学习技术从数据中推断实体嵌入。
- 采用具有共享参数与任务特定参数的多任务学习(MTL)框架,以建模实体异质性,尽管需权衡模型复杂度的增加。
- 借助领域知识与因果推断,提升从观测数据中识别潜在实体特征的可辨识性。
- 通过对抗学习、群体不变特征学习与双层优化实现公平性感知训练,以减少不同实体间的偏差。
- 探索替代先验分布(如Gumbel分布、t分布)以提升极端值预测场景下(如洪水风险或气候建模)的模型鲁棒性。
实验结果
研究问题
- RQ1机器学习模型如何有效整合实体特异性特征,以在低数据场景下提升个性化预测性能?
- RQ2在使用显式可用的实体特征与从数据中推断特征之间,关键的方法论差异与权衡是什么?
- RQ3在EAM中,如何形式化定义并实施公平性,以缓解因数据不平衡或测量误差导致的偏差?
- RQ4不确定性量化与知识引导学习在哪些方面可增强EAM模型的可靠性与可解释性?
- RQ5EAM模型应如何适配多模态或分层的实体结构(如社区或微生物混合系统)?
主要发现
- 通过考虑实体固有的异质性,实体感知建模显著提升了个性化预测性能,尤其在每实体训练数据有限的情况下。
- 即使缺乏显式实体元数据,通过元学习与表征学习等方法推断实体特征,也能实现有效的个性化建模。
- 通过对抗学习与群体不变特征实现的公平性约束,可有效降低对弱势或代表性不足实体的性能差异。
- 双层优化框架支持对预测准确性与公平性进行解耦优化,可处理非可微分的公平性度量。
- 引入领域特定先验(如Gumbel分布或t分布)可提升极端值预测任务(如洪水风险或气候建模)中的模型准确性。
- 当前EAM方法在跨部署环境的公平性与性能泛化方面仍面临挑战,凸显了对鲁棒性感知训练与评估协议的迫切需求。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。