[论文解读] Learning to Identify Regular Expressions that Describe Email Campaigns
本文提出一种结构化预测方法,通过使用邮局管理员标注的训练数据,自动学习描述电子邮件垃圾邮件活动的正则表达式。通过将任务建模为具有自定义损失函数的结构化输出学习问题,该方法在推断类人正则表达式模式方面实现了高准确率,并在一家电子邮件服务提供商的真实案例研究中得到验证。
This paper addresses the problem of inferring a regular expression from a given set of strings that resembles, as closely as possible, the regular expression that a human expert would have written to identify the language. This is motivated by our goal of automating the task of postmasters of an email service who use regular expressions to describe and blacklist email spam campaigns. Training data contains batches of messages and corresponding regular expressions that an expert postmaster feels confident to blacklist. We model this task as a learning problem with structured output spaces and an appropriate loss function, derive a decoder and the resulting optimization problem, and a report on a case study conducted with an email service.
研究动机与目标
- 自动化邮局管理员手动编写正则表达式以黑名单化垃圾邮件活动的任务。
- 解决从标注的消息批次和专家提供的正则表达式模式中学习类人正则表达式的问题。
- 将正则表达式推断任务建模为具有结构化输出空间的结构化预测问题。
- 开发一种在未见垃圾邮件活动中具有良好泛化能力且保持可解释性的学习框架。
提出的方法
- 该方法将正则表达式推断建模为具有表示可能正则表达式的结构化输出空间的结构化预测问题。
- 定义了一个自定义损失函数,用于衡量预测与真实正则表达式模式之间的差异,强调字符串匹配中的精确率和召回率。
- 基于损失函数推导出一个解码器,以引导学习过程向准确生成正则表达式的方向发展。
- 将优化问题表述为:在给定输入消息批次的前提下,最大化正确正则表达式输出的可能性。
- 利用消息字符串的特征表示,引导在可能正则表达式空间中的搜索过程。
- 在一家电子邮件服务提供商的真实世界案例研究中评估该框架,使用实际的垃圾邮件活动数据。
实验结果
研究问题
- RQ1机器学习模型能否学习生成与人类专家为垃圾邮件活动检测所编写的正则表达式高度匹配的正则表达式?
- RQ2所提出的结构化预测方法在从消息批次中推断准确且可泛化正则表达式模式方面的有效性如何?
- RQ3与标准方法相比,自定义损失函数对推断正则表达式质量的影响如何?
- RQ4该模型在未见垃圾邮件活动(训练数据中未出现的)上的泛化能力如何?
- RQ5该方法能否扩展到具有多样化和不断演变的垃圾邮件模式的真实世界电子邮件服务环境?
主要发现
- 所提出的方法在学习与专家标注表达式匹配的正则表达式模式方面,显著优于基线方法。
- 自定义损失函数有助于更好地匹配专家构建的正则表达式,特别是在捕捉垃圾邮件消息中的相关语法和语义模式方面。
- 该模型在未见垃圾邮件活动上表现出良好的泛化能力,在正则表达式匹配中保持了高精确率和高召回率。
- 案例研究证明了实际可行性,展示了该方法在真实电子邮件服务环境中的有效性。
- 该框架实现了对耗时的手动任务的自动化,减少了对专家邮局管理员在正则表达式创建方面依赖。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。