[论文解读] Products-10K: A Large-scale Product Recognition Dataset
tldr:引入 Products-10K,一個大規模、人工標注的 SKU 級產品數據集,涵蓋約 150k 張圖像,屬於 10k 個 SKU,同時提供實用的細粒度識別技巧。提供實驗顯示高分辨率訓練和與度量相關的損失函數能提高準確度。
With the rapid development of electronic commerce, the way of shopping has experienced a revolutionary evolution. To fully meet customers' massive and diverse online shopping needs with quick response, the retailing AI system needs to automatically recognize products from images and videos at the stock-keeping unit (SKU) level with high accuracy. However, product recognition is still a challenging task, since many of SKU-level products are fine-grained and visually similar by a rough glimpse. Although there are already some products benchmarks available, these datasets are either too small (limited number of products) or noisy-labeled (lack of human labeling). In this paper, we construct a human-labeled product image dataset named "Products-10K", which contains 10,000 fine-grained SKU-level products frequently bought by online customers in JD.com. Based on our new database, we also introduced several useful tips and tricks for fine-grained product recognition. The products-10K dataset is available via https://products-10k.github.io/.
研究动机与目标
- 說明為電商識別需要大規模的細粒度 SKU 級數據集的動機。
- 建立一個涵蓋多樣化產品類別、標籤噪聲低的人類標注數據集。
- 提供實用的技巧以在不增加推理成本的情況下提升細粒度產品識別。
提出的方法
- 組裝一個大型、人工標注的 SKU 級產品數據集(Products-10K),包含商店內部與顧客圖像。
- 通過多專家驗證確保低標籤噪聲(每張圖像至少由三位專家核查)。
- 提出訓練技巧:高分辨率輸入、平衡子集微調,以及度量導向的損失設計,使優化與準確率對齊。
- 證明高分辨率訓練在不改變推理成本的情況下可帶來顯著的準確率提升。
- 引入一個以準確率為焦點的損失(L_acc),在微調期間更好地優化 top-1 準確率。
实验结果
研究问题
- RQ1大規模、完全人工標注的 SKU 級數據集是否能提升細粒度的產品識別?
- RQ2高分辨率輸入、平衡微調以及度量對齊的損失是否能提高在複雜產品數據集上的 top-1 準確率?
- RQ3商店內部與顧客圖像如何影響 SKU 識別的泛化能力與對噪聲的魯棒性?
主要发现
- Products-10K 包含近 10k 個 SKU,約 150k 張圖像,標籤噪聲率低於 0.5%。
- 高分辨率訓練(512→448 裁剪)在 top-1 相對於 224×224 基線提升了 4.9 個百分點。
- 平衡子集微調在結合其他技巧後再提升約 1.8%。
- 度量導向的損失在不增加推理成本的情況下提高了準確率的優化,達到驗證集上報告的最佳 top-1。
- 單個 EfficientNet-B3 模型在 448×448 輸入與度量損失微調下達到 64.12% 的 top-1 準確率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。