[论文解读] Active Perceptual Similarity Modeling with Auxiliary Information
本文提出 TACKL,一种用于感知相似性建模的概率主动学习框架,通过联合利用辅助特征(例如深度图像嵌入)和三元组比较,学习准确的对象相似性嵌入。通过主动选择能同时提升基于特征和非参数组件的有信息量三元组,TACKL 在显著减少查询次数的情况下,实现了与最先进方法相当或更优的性能——该结果在包含 296,310 个来自 Zappos 鞋子的用户标注三元组响应的新公开数据集上得到验证。
Learning a model of perceptual similarity from a collection of objects is a fundamental task in machine learning underlying numerous applications. A common way to learn such a model is from relative comparisons in the form of triplets: responses to queries of the form "Is object a more similar to b than it is to c?". If no consideration is made in the determination of which queries to ask, existing similarity learning methods can require a prohibitively large number of responses. In this work, we consider the problem of actively learning from triplets -finding which queries are most useful for learning. Different from previous active triplet learning approaches, we incorporate auxiliary information into our similarity model and introduce an active learning scheme to find queries that are informative for quickly learning both the relevant aspects of auxiliary data and the directly-learned similarity components. Compared to prior approaches, we show that we can learn just as effectively with much fewer queries. For evaluation, we introduce a new dataset of exhaustive triplet comparisons obtained from humans and demonstrate improved performance for different types of auxiliary information.
研究动机与目标
- 减少学习感知相似性模型所需的人工标注三元组查询数量。
- 将辅助信息(例如深度特征)整合到相似性建模中,以提高样本效率。
- 开发一种主动学习策略,选择对基于特征和非参数组件均最具信息量的三元组。
- 在新且全面的人工标注三元组数据集上评估该方法,以实现公平基准测试。
- 证明结合辅助特征的主动选择可实现更快收敛和更高准确性。
提出的方法
- TACKL 将对象相似性建模为一种概率嵌入,结合参数化组件(辅助特征的加权组合)和非参数化组件(从三元组响应中学习)。
- 该方法采用基于似然的概率公式,建模三元组响应正确的概率,从而实现基于信息论的查询选择。
- 通过期望信息增益执行主动查询选择,优先选择能同时降低参数化和非参数化组件不确定性的三元组。
- 模型通过迭代方式训练,在每一批响应后更新嵌入和特征权重。
- 通过众包收集了一个包含 296,310 个来自 85 张 Zappos 鞋子图像的人工标注三元组响应的新数据集,以支持严格评估。
- 应用主成分分析将辅助特征降维至三维,以实现可视化和高效计算。
实验结果
研究问题
- RQ1是否可以通过主动选择三元组查询,显著减少所需的人工响应数量,同时保持高相似性模型准确性?
- RQ2整合辅助特征(例如深度图像嵌入)在多大程度上能提升感知相似性学习的样本效率?
- RQ3同时优化特征和非参数组件的主动学习,在多大程度上优于随机查询选择?
- RQ4概率框架是否能有效平衡从辅助数据和直接三元组反馈中学习?
- RQ5在初始反馈极少的冷启动条件下,模型表现如何?
主要发现
- 在 30 轮后,TACKL 的平均查询误差为 0.3882,性能与仅使用完整 ImageNet 特征训练的模型相当或更优。
- 与随机选择相比,该方法将所需查询数量减少了高达 80%,同时保持了相当的准确性。
- A-TACKL 在误差和似然度量上均优于 A-CKL,尤其在早期轮次表现更优,归因于对辅助特征的有效利用。
- 在 30 次响应后,A-TACKL 确保所有正确响应中,对象 a 与 c 之间的距离大于 a 与 b 之间距离的两倍,表明模型具有良好的校准性。
- 模型对标签噪声表现出鲁棒性,82% 的三元组获得三位标注者的一致认可。
- A-TACKL 在 30 轮后学习到的嵌入在二维投影中显示出有意义的聚类,反映出感知相似性的结构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。