[论文解读] Lie Algebrized Gaussians for Image Representation
本文提出了一种名为李代数高斯分布(Lie Algebrized Gaussians, LAG)的新图像表征方法,该方法利用李群理论将从图像中提取的高斯混合模型(GMM)向量化。通过将GMM分量映射到以通用背景模型(UBM)为中心的李群流形的切空间,LAG保留了局部几何结构,并在15Scenes基准上实现了88.4%的最先进准确率,仅使用简单的最近质心分类器。
We present an image representation method which is derived from analyzing Gaussian probability density function (\emph{pdf}) space using Lie group theory. In our proposed method, images are modeled by Gaussian mixture models (GMMs) which are adapted from a globally trained GMM called universal background model (UBM). Then we vectorize the GMMs based on two facts: (1) components of image-specific GMMs are closely grouped together around their corresponding component of the UBM due to the characteristic of the UBM adaption procedure; (2) Gaussian \emph{pdf}s form a Lie group, which is a differentiable manifold rather than a vector space. We map each Gaussian component to the tangent vector space (named Lie algebra) of Lie group at the manifold position of UBM. The final feature vector, named Lie algebrized Gaussians (LAG) is then constructed by combining the Lie algebrized Gaussian components with mixture weights. We apply LAG features to scene category recognition problem and observe state-of-the-art performance on 15Scenes benchmark.
研究动机与目标
- 为解决基于GMM的图像表征向量化问题,因为这些表征天然不构成向量空间。
- 利用高斯概率密度函数(pdf)的内在几何结构,其本身构成一个李群。
- 通过李代数映射保留GMM分量的流形结构,从而改进图像表征。
- 在场景类别识别中超越现有GMM向量化方法,特别是基于KL散度的方法。
- 在使用简单但强大的最近质心分类器的分类流程中,展示LAG的有效性。
提出的方法
- 使用MAP自适应方法从全局训练的通用背景模型(UBM)中训练高斯混合模型(GMM)来建模图像。
- 将每个GMM分量表示为上三角正定仿射变换(UTDAT)矩阵,该矩阵与高斯pdf同构。
- 认识到UTDAT矩阵构成一个李群,因此GMM分量位于一个可微流形上。
- 将每个图像特定的GMM分量映射到李群在对应UBM分量位置处的切空间(李代数)。
- 通过乘积和近似方法,将李代数化的分量与其混合权重组合,构建最终的LAG特征。
- 在使用最近质心分类器进行分类前,应用判别性噪声属性投影(NAP)以减少类内差异。
实验结果
研究问题
- RQ1能否利用李群理论推导出比现有方法更有效的基于GMM的图像表征向量化方法?
- RQ2通过李代数映射保留高斯pdf的流形结构,对识别性能有何影响?
- RQ3与基于KL散度的方法相比,通过UBM对齐实现的协方差信息整合与均值中心化是否能提升GMM向量化性能?
- RQ4LAG表征在不同高斯混合分量数量下具有多大程度的泛化能力?
- RQ5LAG能否在仅使用最小化分类流程的情况下实现场景类别识别的最先进性能?
主要发现
- LAG特征在15Scenes基准上实现了88.4%的平均准确率,优于最先进方法。
- 简化版LAG(不包含协方差信息)实现了87.36%的准确率,表明仅通过均值中心化即可显著提升性能,优于KLVec。
- 在LAG中引入协方差信息相比简化版LAG使准确率提升1%,证实其价值。
- 在所有测试的混合分量数量(32至1024)下,LAG始终优于简化版LAG和KLVec。
- 即使仅使用32个分量,LAG仍达到86.41%的准确率,表明其具有强大的效率和鲁棒性。
- 本研究中KLVec基线的准确率为83.84%,低于先前工作中报告的84.27%,可能是因为缺少如高斯图等空间信息组件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。