[论文解读] Collaborative Feature Learning from Social Media
本文提出了一种从社交媒体用户行为数据中进行协作特征学习的方法,无需依赖类别标签。通过利用 Behance.net 上 190 万名用户的浏览记录,该方法通过学习潜在的图像关联关系来提取图像特征,在图像相似性任务中表现优异,并在图像识别基准测试中取得具有竞争力的结果,在风格相似性任务中优于 ImageNet 特征。
Image feature representation plays an essential role in image recognition and related tasks. The current state-of-the-art feature learning paradigm is supervised learning from labeled data. However, this paradigm requires large-scale category labels, which limits its applicability to domains where labels are hard to obtain. In this paper, we propose a new data-driven feature learning paradigm which does not rely on category labels. Instead, we learn from user behavior data collected on social media. Concretely, we use the image relationship discovered in the latent space from the user behavior data to guide the image feature learning. We collect a large-scale image and user behavior dataset from Behance.net. The dataset consists of 1.9 million images and over 300 million view records from 1.9 million users. We validate our feature learning paradigm on this dataset and find that the learned feature significantly outperforms the state-of-the-art image features in learning better image similarities. We also show that the learned feature performs competitively on various recognition benchmarks.
研究动机与目标
- 开发一种不依赖昂贵类别标签的数据驱动特征学习范式。
- 利用社交媒体平台的用户行为数据学习有意义的图像表征。
- 验证使用真实世界大规模社交媒体数据进行特征学习的有效性。
- 证明用户交互模式可以生成高质量的视觉和语义特征。
- 探索使用非标注的、基于行为的数据在视觉任务中进行特征学习的可行性。
提出的方法
- 从 Behance.net 收集包含 190 万张图像和超过 3 亿条用户浏览记录的大规模数据集。
- 利用用户浏览行为推断共享嵌入空间中的潜在图像关联关系与相似性。
- 应用协同过滤技术建模用户偏好以及跨用户的图像共现模式。
- 学习从原始图像到捕捉视觉与语义内容的潜在表征的特征变换。
- 使用推断出的图像关联关系作为监督信号训练深度神经网络,而无需类别标签。
- 采用对比损失或类似目标函数优化潜在空间以提升图像相似性。
实验结果
研究问题
- RQ1能否有效利用社交媒体上的用户行为数据,在无类别标签的情况下学习到高质量的图像特征?
- RQ2从社交媒体行为中学习到的特征在图像相似性与识别任务中的泛化能力如何?
- RQ3协作特征学习能否在基于风格的图像检索任务中超越像 ImageNet 这类监督预训练特征?
- RQ4该方法对用户行为数据中的噪声和稀疏性有多强的鲁棒性?
- RQ5社交媒体交互模式在多大程度上能反映图像之间的视觉与语义关系?
主要发现
- 如图 1 所示,所提出的特征在学习图像相似性方面优于 ImageNet 特征,特别是在内容一致性和风格一致性方面。
- 在 Behance 数据集上,该方法在查询图像与其前 100 名最近邻图像之间的共同浏览者比例平均值持续高于 ImageNet 基线。
- 在 AVA 风格基准上,该特征达到 56.0% 的准确率,优于 ImageNet 特征(51.3%)和 Meta-Class(53.9%)。
- 在 Wikipaintings 上,该方法达到 41.4% 的准确率,略高于 ImageNet 特征(40.7%),并显著优于 Meta-Class(38.6%)。
- 在 Caltech256 上,该特征达到 57.6% 的准确率,尽管训练过程中未使用类别标签,但仍表现出具有竞争力的性能。
- 通过利用数百万名用户的集体行为模式,该方法对数据稀疏性和噪声表现出良好的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。