[论文解读] Image Retrieval with Fisher Vectors of Binary Features
本文提出了首个基于伯努利混合模型(BMM)的二值特征闭式Fisher向量表示方法,实现了图像检索中相对于传统词袋视觉词(BoVW)方法的显著精度提升。该方法通过后验概率近似加速计算,在仅损失少量性能的情况下实现最高10倍的加速,优于BoVW及现有归一化技术。
Recently, the Fisher vector representation of local features has attracted much attention because of its effectiveness in both image classification and image retrieval. Another trend in the area of image retrieval is the use of binary features such as ORB, FREAK, and BRISK. Considering the significant performance improvement for accuracy in both image classification and retrieval by the Fisher vector of continuous feature descriptors, if the Fisher vector were also to be applied to binary features, we would receive similar benefits in binary feature based image retrieval and classification. In this paper, we derive the closed-form approximation of the Fisher vector of binary features modeled by the Bernoulli mixture model. We also propose accelerating the Fisher vector by using the approximate value of posterior probability. Experiments show that the Fisher vector representation significantly improves the accuracy of image retrieval compared with a bag of binary words approach.
研究动机与目标
- 将已在SIFT等连续特征上被证明有效的强大Fisher向量表示方法,扩展至二值特征(如ORB、FREAK和BRISK)。
- 解决当前图像检索中二值特征缺乏有效编码方法的问题,目前该领域仍依赖次优的词袋视觉词(BoVW)方法。
- 在伯努利混合模型(BMM)下推导二值特征的Fisher向量闭式近似,实现实际部署的可行性。
- 通过后验概率近似加速二值特征的Fisher向量计算,将运行时间减少一个数量级。
提出的方法
- 使用伯努利混合模型(BMM)建模二值特征,将二值描述符中的每一位视为一个伯努利分布的随机变量。
- 在假设Fisher信息矩阵为对角矩阵且后验概率呈尖峰分布的前提下,通过计算对数似然函数对模型参数的梯度,推导出BMM的闭式Fisher向量表示。
- 通过使用最大占用概率近似组件分配的后验概率,降低计算成本,同时保持高精度。
- 对Fisher向量应用幂次归一化和ℓ₂归一化,证明原本为VLAD设计的归一化方法同样能提升Fisher向量的性能。
- 采用一种快速近似方法,用基于组件概率argmax的启发式方法替代精确后验计算,实现10倍加速,仅造成3–8%的MAP得分下降。
- 在标准图像检索基准上,使用多种二值特征类型验证该方法,与BoVW及标准归一化方案进行对比。
实验结果
研究问题
- RQ1Fisher向量表示能否有效扩展至二值特征?这些特征通常在BoVW中通过直方图建模。
- RQ2使用伯努利混合模型(BMM)对二值特征建模,是否能生成捕捉到直方图之外更高阶统计信息的闭式Fisher向量?
- RQ3如何在不显著损失检索精度的前提下,加速二值特征Fisher向量的计算?
- RQ4原本为其他向量表示(如VLAD)设计的归一化方法,是否同样能提升所提出的二值特征Fisher向量的性能?
- RQ5在不同物体类别和数据库规模下,所提出的Fisher向量与BoVW相比,在检索精度上表现如何?
主要发现
- 所提出的二值特征Fisher向量表示在所有评估的数据集和物体类别上,显著优于词袋视觉词(BoVW)基线方法。
- 采用幂次归一化和ℓ₂归一化的Fisher向量性能远超未归一化版本,表明归一化对获得最佳结果至关重要。
- 快速近似方法将计算时间减少了一个数量级(10倍),同时在不同数据集上仅造成3–8%的平均平均精度(MAP)下降。
- 原本为VLAD设计的归一化方法在二值特征的Fisher向量上也表现出色,优于传统归一化技术。
- 随着数据库规模增大,Fisher向量相对于BoVW的性能优势更加明显,表明其具备良好的可扩展性和鲁棒性。
- 使用最大占用概率近似后验概率的方法,在N=512时仍达到57%的准确率,支持其在实际应用中的可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。