[论文解读] A Bag of Visual Words Approach for Symbols-Based Coarse-Grained Ancient Coin Classification
本文提出了一种基于视觉词袋(BoVW)框架的方法,用于利用古罗马钱币反面的符号对古代罗马钱币进行粗粒度分类。通过采用矩形、对数极坐标和圆形分块方式引入空间信息,该方法显著提升了分类准确率,其中圆形分块表现最优,因其具备旋转不变性,且在基于符号的分类任务中表现更佳。
The field of Numismatics provides the names and descriptions of the symbols minted on the ancient coins. Classification of the ancient coins aims at assigning a given coin to its issuer. Various issuers used various symbols for their coins. We propose to use these symbols for a framework that will coarsely classify the ancient coins. Bag of visual words (BoVWs) is a well established visual recognition technique applied to various problems in computer vision like object and scene recognition. Improvements have been made by incorporating the spatial information to this technique. We apply the BoVWs technique to our problem and use three symbols for coarse-grained classification. We use rectangular tiling, log-polar tiling and circular tiling to incorporate spatial information to BoVWs. Experimental results show that the circular tiling proves superior to the rest of the methods for our problem.
研究动机与目标
- 通过利用钱币反面视觉特征实现快速、自动且无需专家参与的古罗马钱币分类。
- 解决由于磨损、老化及手工铸造工艺导致的古钱币类内差异大、类间相似度高的挑战。
- 通过多种分块策略集成空间信息,改进传统BoVW方法,提升判别能力。
- 通过结合钱币学知识验证基于符号的分类方法相较于基于肖像的方法的优越性,确保语义相关性。
- 为可扩展、符号感知的古钱币识别系统奠定基础,采用计算机视觉技术实现。
提出的方法
- 从古钱币反面图像中提取密集SIFT特征,以捕捉局部纹理与形状信息。
- 基于训练集中随机选取的SIFT特征子集,使用k-means聚类构建视觉词汇表,词汇表大小范围为10至800。
- 应用三种空间分块方法——矩形、对数极坐标和圆形——以编码BoVW表示中视觉词的空间分布。
- 对于圆形分块,基于图像的较小尺寸定义同心圆,并将每一分块内视觉词的直方图拼接成最终大小为M×r的特征向量。
- 利用RBF核的一对多SVM对带有空间编码的BoVW特征进行分类,并通过训练集上的n折交叉验证进行超参数优化。
- 该框架在包含3,900枚罗马共和国钱币、共550个类别的数据集上进行评估,重点关注三种符号类别:狮鹫、曲柄椅与母狼。
实验结果
研究问题
- RQ1能否利用古钱币反面的符号视觉特征实现有效的粗粒度分类?
- RQ2在视觉差异较大的古钱币中,将空间信息整合进BoVW框架如何提升分类准确率?
- RQ3在矩形、对数极坐标与圆形三种分块策略中,哪一种最能保持判别能力并维持旋转不变性?
- RQ4所提出的方法是否优于不使用空间编码的传统BoVW方法,或仅依赖SIFT关键点匹配的方法?
- RQ5空间分块方法的性能在多大程度上依赖于词汇表大小与训练特征数量?
主要发现
- 所有三种空间分块方法(矩形、对数极坐标、圆形)均显著优于不使用空间信息的标准BoVW方法。
- 圆形分块在所有词汇表大小(10至800)下均取得最高分类准确率,尤其在小词汇表(10–100)时表现尤为突出。
- 随着词汇表大小增加,圆形分块与其他分块方法之间的性能差距逐渐缩小,表明在大词汇表下趋于收敛。
- 圆形分块性能优越的原因在于其固有的旋转不变性,可在图像旋转下稳定特征表示。
- 在大词汇表下,不同分块方法之间性能差异不显著,表明高维特征空间可能降低对分块方式的敏感性。
- 该方法实现了稳健的基于符号的分类,验证了使用具有钱币学意义的符号作为主要线索在自动化钱币识别中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。