Skip to main content
QUICK REVIEW

[论文解读] An End-to-End Solution for Named Entity Recognition in eCommerce Search

Xiang Cheng, Mitchell Bowden|arXiv (Cornell University)|Dec 11, 2020
Topic Modeling参考文献 20被引用 5
一句话总结

本文提出TripleLearn,一种用于电子商务搜索命名实体识别(NER)的端到端、迭代式训练框架,通过联合训练三种不同类型的训练数据——高质量的黄金数据、合成实体数据以及大规模的噪声真实查询数据——显著提升了模型性能。该方法使测试集上的F1分数从69.5提升至93.3,并在homedepot.com的线上A/B测试中显著提升了用户参与度与收入,充分证明了其在工业场景中的强适用性与可泛化性,适用于其他具有类似数据挑战的NLP任务。

ABSTRACT

Named entity recognition (NER) is a critical step in modern search query understanding. In the domain of eCommerce, identifying the key entities, such as brand and product type, can help a search engine retrieve relevant products and therefore offer an engaging shopping experience. Recent research shows promising results on shared benchmark NER tasks using deep learning methods, but there are still unique challenges in the industry regarding domain knowledge, training data, and model production. This paper demonstrates an end-to-end solution to address these challenges. The core of our solution is a novel model training framework "TripleLearn" which iteratively learns from three separate training datasets, instead of one training set as is traditionally done. Using this approach, the best model lifts the F1 score from 69.5 to 93.3 on the holdout test data. In our offline experiments, TripleLearn improved the model performance compared to traditional training approaches which use a single set of training data. Moreover, in the online A/B test, we see significant improvements in user engagement and revenue conversion. The model has been live on homedepot.com for more than 9 months, boosting search conversions and revenue. Beyond our application, this TripleLearn framework, as well as the end-to-end process, is model-independent and problem-independent, so it can be generalized to more industrial applications, especially to the eCommerce industry which has similar data foundations and problems.

研究动机与目标

  • 为解决学术NER研究与工业级电子商务搜索部署之间的差距,即高质量训练数据稀缺且难以获取的问题。
  • 通过利用三类特征各异的数据源——高质量标注数据、全面覆盖的合成实体数据以及真实世界中的噪声查询数据——提升电子商务场景下的NER性能。
  • 构建一个可扩展、可维护且可投入生产的NER流水线,能够随着产品目录的演进而逐步更新。
  • 证明迭代式、多源训练方法在提升模型泛化能力与真实世界性能方面,优于传统单数据集微调方法。
  • 将TripleLearn框架推广至其他具有类似数据约束的工业NLP问题,如实体识别、机器翻译或知识图谱增强。

提出的方法

  • TripleLearn采用迭代训练循环,交替在三类不同数据集上进行训练:黄金数据(人工标注,高质量)、合成数据(全面覆盖实体,聚焦于实体覆盖)以及噪声数据(大规模真实搜索查询)。
  • 在每次迭代中,使用三类数据的组合对模型进行再训练,并在黄金数据上进行验证,以监控性能并防止过拟合。
  • 合成数据通过程序化方式生成,利用产品目录和实体词典,覆盖所有可能的品牌与产品类型组合,包括罕见或未见的组合。
  • 噪声数据源自真实搜索日志,捕捉用户查询中常见的自然语言变体、拼写错误和模糊表达。
  • 该框架与模型无关,可应用于任何监督序列标注模型,如CRF、BiLSTM或基于Transformer的架构。
  • 训练流水线支持增量更新——仅当新增产品时需重新训练合成数据,从而实现高效的模型维护。

实验结果

研究问题

  • RQ1迭代式、多源训练框架是否能在电子商务搜索NER任务中,超越传统单数据集微调方法,实现性能提升?
  • RQ2将高质量标注数据、全面的合成数据与真实世界的噪声查询相结合,如何影响模型的泛化能力与F1分数?
  • RQ3此类框架是否可在产品目录持续演化的生产环境中实现实际维护与增量更新?
  • RQ4TripleLearn方法是否在真实线上A/B测试中带来可量化的用户参与度与收入提升?
  • RQ5TripleLearn框架在多大程度上可泛化至其他具有类似数据挑战的工业NLP任务?

主要发现

  • TripleLearn框架使测试集上的F1分数从69.5提升至93.3,显著优于传统单数据集训练方法。
  • 在homedepot.com的线上A/B测试中,由TripleLearn驱动的模型显著提升了用户参与度与收入转化率,证明了其在真实业务场景中的影响。
  • 该模型已在生产环境稳定运行超过9个月,展现出在高流量真实电子商务环境中的稳定性能与可扩展性。
  • 该框架实现了高效的模型维护:仅当新增产品时需重新训练合成数据,显著降低了运维开销。
  • 该方法在NER之外也具有良好泛化能力,潜在适用于机器翻译、知识图谱增强等其他具有类似数据约束的工业NLP任务。
  • 迭代式多监督策略模拟了人类学习过程——如同使用教科书(黄金数据)、字典(合成数据)和真实世界输入(噪声数据)——并在实践中被证明极为有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。