[论文解读] ONTS: "Optima" News Translation System
ONTS 是一个基于 Moses 构建的实时、内部部署机器翻译系统,用于将 11 种语言(例如阿拉伯语、法语、土耳其语)的实时新闻文章翻译成英文,针对速度和新闻领域特性进行了优化。通过预先对文章进行分类、使用专用命名实体仓库、单独翻译标题以及应用语言特定的预处理,该系统在波兰语和葡萄牙语等低资源语言上的表现优于 Google 翻译。
We propose a real-time machine translation system that allows users to select a news category and to translate the related live news articles from Arabic, Czech, Danish, Farsi, French, German, Italian, Polish, Portuguese, Spanish and Turkish into English. The Moses-based system was optimised for the news domain and differs from other available systems in four ways: (1) News items are automatically categorised on the source side, before translation; (2) Named entity translation is optimised by recognising and extracting them on the source side and by re-inserting their translation in the target language, making use of a separate entity repository; (3) News titles are translated with a separate translation system which is optimised for the specific style of news titles; (4) The system was optimised for speed in order to cope with the large volume of daily news articles.
研究动机与目标
- 开发一个私有的内部机器翻译系统,避免第三方数据泄露,同时实现实时多语言新闻翻译。
- 通过利用文档结构和领域特定资源,提升新闻文章的翻译质量和效率。
- 通过提供‘概要’翻译而非完美的语言准确性,帮助用户快速评估文章的相关性。
- 减少对 Google 翻译等商业服务的依赖,这些服务限制使用并暴露用户数据。
- 将系统集成到 Europe Media Monitor 管道中,实现大规模、每日新闻处理。
提出的方法
- 该系统采用模块化处理流程:新闻文章在翻译前通过语言特定的分词、小写转换和复合词拆分进行预处理。
- 使用语言无关的规则在源端提取命名实体,并与多语言实体仓库匹配,以确保翻译的一致性。
- 为新闻标题专门训练并应用一个翻译模型,优化了标题风格和简洁性。
- 系统采用多线程 Moses 服务器和 KenLM 进行语言建模,支持每秒处理高达 100,000 篇文章。
- 一个自定义的 Java Servlet 负责处理 RSS 输入,将文章路由至相应的语言模型,并管理后处理(去分词、首字母大写恢复、未知词日志记录)。
- 该架构支持未来在多台机器上分布部署,以提升可扩展性和性能。
实验结果
研究问题
- RQ1如何在保护用户数据隐私的前提下,为新闻领域优化一个实时、内部部署的机器翻译系统?
- RQ2对命名实体和标题进行单独预处理,在多语言新闻翻译中能在多大程度上提升翻译质量?
- RQ3基于开源 SMT 工具(如 Moses)构建的系统,是否能在训练数据有限和计算资源受限的情况下实现具有竞争力的性能?
- RQ4语言特定的预处理和模块化架构如何影响翻译速度和可扩展性?
- RQ5与通用服务相比,领域特定的适应(如新闻风格、实体处理)对翻译性能的影响如何?
主要发现
- ONTS 在波兰语(0.568 对 0.511 BLEU)和葡萄牙语(0.579 对 0.424 BLEU)上的表现优于 Google 翻译,表明其在领域特定优化方面具有显著优势。
- 对于阿拉伯语和波斯语,命名实体处理显著提升了翻译覆盖率和质量,因为每个英文实体引用都提高了源端识别的准确性。
- 土耳其语的翻译性能仍然较差(0.238 BLEU),可能由于其高度复杂的词形变化以及新闻领域训练数据不足。
- 系统实现了实时性能,使用一台 2×四核服务器(48GB 内存)可每日处理多达 100,000 篇文章,覆盖 11 种语言。
- 翻译时间按字符单位报告,界面显示每字符的毫秒数,使用户能够评估处理效率。
- 该系统可通过 http://optima.jrc.it/Translate/ 公开访问演示版,支持自定义模块,包括实体处理、首字母大写恢复和未知词报告。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。