[论文解读] Physics-Informed Computer Vision: A Review and Perspectives
本文提出了一套物理信息计算机视觉(PICV)的系统性分类法,通过修改数据、网络架构或损失函数,将物理定律整合到计算机视觉流程中。综述了流体动力学、电磁模型和运动学约束等物理先验如何在3D重建、人体运动分析和视频预测等任务中提升模型的鲁棒性、数据效率和物理合理性。
The incorporation of physical information in machine learning frameworks is opening and transforming many application domains. Here the learning process is augmented through the induction of fundamental knowledge and governing physical laws. In this work, we explore their utility for computer vision tasks in interpreting and understanding visual data. We present a systematic literature review of more than 250 papers on formulation and approaches to computer vision tasks guided by physical laws. We begin by decomposing the popular computer vision pipeline into a taxonomy of stages and investigate approaches to incorporate governing physical equations in each stage. Existing approaches in computer vision tasks are analyzed with regard to what governing physical processes are modeled and formulated, and how they are incorporated, i.e. modification of input data (observation bias), modification of network architectures (inductive bias), and modification of training losses (learning bias). The taxonomy offers a unified view of the application of the physics-informed capability, highlighting where physics-informed learning has been conducted and where the gaps and opportunities are. Finally, we highlight open problems and challenges to inform future research. While still in its early days, the study of physics-informed computer vision has the promise to develop better computer vision models that can improve physical plausibility, accuracy, data efficiency, and generalization in increasingly realistic applications.
研究动机与目标
- 为解决纯数据驱动的计算机视觉模型常缺乏物理合理性、可解释性以及在稀疏或噪声数据下的泛化能力等问题。
- 通过将计算机视觉流程分解为可系统集成物理定律的阶段,建立统一框架以整合物理定律。
- 识别当前PICV应用中的研究空白,特别是在分类、分割和人群分析任务中,物理先验仍被低估。
- 全面综述成像、人体运动、机器人学和3D重建领域中物理信息方法的应用,突出有效策略与开放挑战。
- 倡导建立标准化基准平台,以实现跨不同领域对PICV方法的公平评估与比较。
提出的方法
- 基于三种集成策略提出物理信息计算机视觉(PICV)的分类法:观测偏差(修改输入数据)、归纳偏差(修改网络架构)和学习偏差(修改损失函数)。
- 按类型对物理先验进行分类,例如:流体动力学使用纳维-斯托克斯方程,成像使用麦克斯韦方程,3D重建使用几何约束,人体运动使用运动学限制。
- 分析物理定律的编码方式:作为损失函数中的显式方程(如PDE约束训练)、正则化项,或作为辅助网络输入。
- 综述跨领域的案例研究:基于NERF的3D重建使用几何先验,人体姿态估计结合解剖学关节限制,人群运动建模通过熵和序参量实现。
- 将物理信息机器学习(PIML)的洞见融入计算机视觉,将PDE约束神经网络和物理引导的生成模型适配至视觉数据模态。
- 采用基于流程的框架,将物理先验映射至特定计算机视觉阶段(如特征提取、回归、生成),实现对集成点的系统性分析。

实验结果
研究问题
- RQ1如何系统性地将物理定律整合到计算机视觉流程的不同阶段,以提升模型性能与物理一致性?
- RQ2在不同计算机视觉任务中,哪些类型的物理先验(如流体动力学、电磁模型、运动学约束)最为有效?
- RQ3观测偏差、归纳偏差与学习偏差在模型准确率、数据效率与泛化能力方面的影响有何不同?
- RQ4尽管具有潜力,为何物理信息方法在图像分类、语义分割和人群分析等任务中仍应用有限?
- RQ5由于领域特定数据集的存在以及缺乏标准化平台,基准测试与评估PICV模型面临哪些关键挑战?
主要发现
- 过去五年中,PICV相关论文数量呈指数级增长,其中在流体与固体力学领域应用最广,其次为成像与光子学应用。
- 物理信息模型可提升数据效率与泛化能力,尤其在高维或数据稀缺的场景中,如3D重建与人体运动分析。
- 在人体运动追踪中,引入关节限制与运动学一致性等物理约束,可提升姿态估计的准确性与时间一致性。
- 采用物理信息损失函数(如强制满足PDE,如纳维-斯托克斯方程或热传导方程)可使视频预测与超分辨率任务的预测结果更具物理合理性。
- 尽管已有进展,但在分类、分割与人群分析任务中,物理先验的利用仍严重不足,远低于在生成或预测任务中的应用。
- 缺乏标准化的基准平台,阻碍了PICV方法的公平比较与可复现性,限制了该领域的发展与采纳。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。