Skip to main content
QUICK REVIEW

[论文解读] PETCI: A Parallel English Translation Dataset of Chinese Idioms

Kenan Tang|arXiv (Cornell University)|Feb 19, 2022
Natural Language Processing Techniques被引用 5
一句话总结

PETCI 是一个通过结合字典中的人工翻译与 Google 和 DeepL 的机器翻译而创建的中文成语并行英文翻译数据集。该数据集支持通过结构感知分类模型实现更优的成语翻译,其性能优于基线模型;同时,由于数据集具备可扩展性,无需语言学专业知识即可轻松扩展,从而惠及机器翻译与语言学习。

ABSTRACT

Idioms are an important language phenomenon in Chinese, but idiom translation is notoriously hard. Current machine translation models perform poorly on idiom translation, while idioms are sparse in many translation datasets. We present PETCI, a parallel English translation dataset of Chinese idioms, aiming to improve idiom translation by both human and machine. The dataset is built by leveraging human and machine effort. Baseline generation models show unsatisfactory abilities to improve translation, but structure-aware classification models show good performance on distinguishing good translations. Furthermore, the size of PETCI can be easily increased without expertise. Overall, PETCI can be helpful to language learners and machine translation systems.

研究动机与目标

  • 解决当前缺乏高质量、中英成语翻译并行数据集的问题,以提升机器翻译与语言学习效果。
  • 创建一个可扩展的数据集,结合人工与机器翻译,以提升成语翻译性能。
  • 开发并评估分类与重写任务,用于识别并改进低质量翻译。
  • 实现在无需语言学专业知识的前提下扩展数据集,支持模型训练与评估。
  • 提供一个公开可用的资源,支持自然语言处理研究与语言教育。

提出的方法

  • 使用 OCR 技术与人工校验,从纸质中文成语词典中收集人工翻译。
  • 通过网络爬取 Google 和 DeepL 界面,获取替代性机器翻译。
  • 设计二分类任务,利用结构与词汇特征区分高质量(黄金标准)翻译与低质量翻译。
  • 创建重写任务,旨在改进低质量翻译,模型训练目标为生成更优的改写版本。
  • 采用 BERT、Tree-LSTM 和 LSTM 等神经网络模型进行分类与生成任务,性能通过准确率与困惑度进行评估。
  • 使用 Tesseract OCR 与自定义脚本提取并验证翻译,通过自动化与人工检查确保数据质量。

实验结果

研究问题

  • RQ1结合人工与机器翻译的并行数据集是否能提升模型在中文成语翻译任务上的表现?
  • RQ2结构感知模型(如 Tree-LSTM 和 BERT)与标准序列模型相比,在分类高质量成语翻译时表现如何?
  • RQ3随着 PETCI 数据集规模增大,模型性能是否得到提升,尤其是在分类任务中?
  • RQ4为何重写模型尽管训练困惑度降低,却仍无法泛化?
  • RQ5在不依赖语言学专业知识的前提下,数据集可扩展到何种程度?这种扩展对模型性能有何影响?

主要发现

  • 结构感知模型(如 Tree-LSTM 和 BERT)在分类高质量翻译任务中优于标准 LSTM 模型,尤其在 Human 数据集上表现更优。
  • 分类模型的性能随数据集规模增大而提升,表明数据集具备可扩展性,且未来使用更大规模数据有望获得进一步性能增益。
  • 重写任务因过拟合而失败:训练困惑度下降,但开发集困惑度保持高位,表明当前生成模型难以应对该任务的挑战。
  • 基线模型在重写任务中表现较差,测试集性能明显不足,表明需要引入检索增强生成或更优的归纳偏置。
  • 数据集设计支持无需语言学专业知识的轻松扩展,分类任务的成功扩展已证明这一点。
  • 在 Human 数据集上,BERT 的黄金翻译准确率下降速度高于 Tree-LSTM,可能由于结构混淆;而 Machine 数据集引起的混淆程度较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。