[论文解读] Multi-Modal Generative Adversarial Network for Short Product Title Generation in Mobile E-Commerce
本文提出MM-GAN,一种多模态生成对抗网络,整合文本、视觉和属性信息,为移动端电商生成简洁、类人风格的产品标题。通过将标题生成任务建模为强化学习问题,并由判别器以类人方式评估输出,MM-GAN在真实A/B测试中表现优于最先进方法,点击率提升1.66%,点击转化率提升1.87%。
Nowadays, more and more customers browse and purchase products in favor of using mobile E-Commerce Apps such as Taobao and Amazon. Since merchants are usually inclined to describe redundant and over-informative product titles to attract attentions from customers, it is important to concisely display short product titles on limited screen of mobile phones. To address this discrepancy, previous studies mainly consider textual information of long product titles and lacks of human-like view during training and evaluation process. In this paper, we propose a Multi-Modal Generative Adversarial Network (MM-GAN) for short product title generation in E-Commerce, which innovatively incorporates image information and attribute tags from product, as well as textual information from original long titles. MM-GAN poses short title generation as a reinforcement learning process, where the generated titles are evaluated by the discriminator in a human-like view. Extensive experiments on a large-scale E-Commerce dataset demonstrate that our algorithm outperforms other state-of-the-art methods. Moreover, we deploy our model into a real-world online E-Commerce environment and effectively boost the performance of click through rate and click conversion rate by 1.66% and 1.87%, respectively.
研究动机与目标
- 为移动电商应用中屏幕空间有限的场景,解决生成简洁、信息丰富产品标题的挑战。
- 克服仅依赖文本模型所面临的曝光偏差问题,并解决缺乏整体评估的局限性。
- 将多模态输入——文本、产品图像和属性标签——整合到统一的生成框架中,以提升标题质量。
- 在真实在线环境中评估模型,并验证其对点击率(CTR)和点击转化率(CVR)等关键业务指标的影响。
提出的方法
- MM-GAN采用生成器,利用长标题、产品图像的视觉特征和属性标签作为输入,生成简短的产品标题。
- 生成器通过强化学习进行训练,其奖励信号来自一个判别器,该判别器评估生成的标题是人类撰写还是机器生成的。
- 判别器经过训练,能够区分真实人类撰写的标题与机器生成的标题,从而使生成器学习到类人风格的流畅性与连贯性。
- 视觉特征通过卷积神经网络(CNN)提取,而文本和属性特征则通过深度神经网络编码。
- 该模型采用序列到序列架构,并结合注意力机制,以生成流畅且信息丰富的简短标题。
- 训练过程通过评估完整序列而非使用最大似然估计(MLE)自回归预测单个词元,避免了曝光偏差。
实验结果
研究问题
- RQ1与仅使用文本的模型相比,多模态输入(文本、图像、属性)是否能提升短产品标题生成的质量?
- RQ2将标题生成建模为强化学习任务,并引入类人风格判别器,是否能减少曝光偏差,并提升流畅性与信息量?
- RQ3视觉和属性信息的引入在多大程度上有助于从长标题中过滤掉无关或冗余的词语?
- RQ4所提出的模型在多大程度上改善了真实电商环境中的关键指标,如点击率(CTR)和点击转化率(CVR)?
主要发现
- 在淘宝App的真实A/B测试中,MM-GAN相较于基线系统,点击率(CTR)提升了1.66%。
- 在相同的A/B测试中,该模型使点击转化率(CVR)提升了1.87%,表明用户参与度和购买意愿更高。
- 定性分析显示,MM-GAN生成的标题更具流畅性、信息量更丰富,并能准确捕捉核心产品属性,如“Artka”和“retro”。
- 与FE-Net和Agree-MTL等基线模型相比,MM-GAN能更准确地过滤掉长标题中过度信息化或无关的术语。
- 该模型在包括女装、男装在内的七个多样化产品类别中均表现出稳健性能,表明其具有广泛的适用性。
- 尽管性能表现强劲,部分生成的标题仍包含重复或无关的词语,表明仍有进一步优化的空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。