Skip to main content
QUICK REVIEW

[论文解读] Empirical Analysis of Korean Public AI Hub Parallel Corpora and in-depth Analysis using LIWC

Chanjun Park, Midan Shim|arXiv (Cornell University)|Oct 28, 2021
Natural Language Processing Techniques被引用 4
一句话总结

本研究利用LIWC对AI Hub发布的七个韩英平行语料库进行语言学分析,并训练基于Transformer的神经机器翻译(NMT)模型。研究发现英译韩与韩译英翻译性能存在显著差异,语料库中存在领域不一致和性别偏见问题,并为低资源语言(如韩语)未来高质量平行语料库的构建提出以数据为中心的改进方案。

ABSTRACT

Machine translation (MT) system aims to translate source language into target language. Recent studies on MT systems mainly focus on neural machine translation (NMT). One factor that significantly affects the performance of NMT is the availability of high-quality parallel corpora. However, high-quality parallel corpora concerning Korean are relatively scarce compared to those associated with other high-resource languages, such as German or Italian. To address this problem, AI Hub recently released seven types of parallel corpora for Korean. In this study, we conduct an in-depth verification of the quality of corresponding parallel corpora through Linguistic Inquiry and Word Count (LIWC) and several relevant experiments. LIWC is a word-counting software program that can analyze corpora in multiple ways and extract linguistic features as a dictionary base. To the best of our knowledge, this study is the first to use LIWC to analyze parallel corpora in the field of NMT. Our findings suggest the direction of further research toward obtaining the improved quality parallel corpora through our correlation analysis in LIWC and NMT performance.

研究动机与目标

  • 评估公开可用的AI Hub韩英平行语料库的质量,这些语料库对推进低资源NMT系统至关重要。
  • 探究通过LIWC提取的语言学特征是否可作为语料库质量与NMT性能的可靠指标。
  • 识别AI Hub语料库构建过程中存在的结构性与语言学缺陷,这些缺陷可能降低NMT模型性能。
  • 为未来平行语料库开发(尤其是韩语等低资源语言)提出以数据为中心的改进方案。
  • 展示利用LIWC作为NMT研究中经验性语料库质量评估的新型工具的可行性与价值。

提出的方法

  • 使用LIWC文本分析工具对AI Hub发布的七个韩英平行语料库进行实证分析,提取词汇数量、情感基调、性别偏见等语言学特征。
  • 在每个独立语料库上训练Transformer-base NMT模型,以评估翻译性能并检测方向特异性差异(如韩译英与英译韩)。
  • 对LIWC提取的语言学特征与NMT模型性能进行相关性分析,以识别具有预测性的质量指标。
  • 识别并分析领域不一致问题(如社会科学研究语料库中混入医学文本)以及语料库中词语使用存在的性别偏见。
  • 提出一种平衡的语料库构建策略——将一半数据以源语言到目标语言、另一半以目标语言到源语言的方向进行翻译,以提升模型公平性与性能。
  • 通过基线NMT实验与定性分析验证研究发现,并为未来的数据筛选与语料库构建实践提供指导。

实验结果

研究问题

  • RQ1通过LIWC提取的语言学特征与韩英平行语料库上NMT模型性能之间存在何种相关性?
  • RQ2AI Hub韩英平行语料库中的关键质量问题(如偏见、领域不一致或不平衡)是什么?
  • RQ3为何在相同平行语料库上训练的韩译英与英译韩NMT模型之间存在显著性能差距?
  • RQ4在低资源语言环境下,LIWC在在多大程度上可作为评估平行语料库质量的可靠代理指标?
  • RQ5哪些语料库构建策略可最大限度减少质量下降,并提升韩英等低资源语言对的NMT性能?

主要发现

  • AI Hub韩英平行语料库在英译韩与韩译英翻译方向上表现出显著的性能差异,表明数据构建存在不平衡。
  • LIWC分析显示多个语料库存在双重性别偏见,特别是在第3.3节和第3.5节,表明翻译中存在系统性代表性不足或错误表征。
  • 社会科学研究语料库中发现领域不一致,其中包含医学文本,损害了特定领域训练的一致性与针对性。
  • 技术类语料库表现出较低的情感基调,但这并非由于情感内容不足,而是由于技术性、简洁性语言使用所致,属正常现象,不构成问题。
  • 与经济相关的语料库中个人兴趣相关词汇的比例最高,表明其聚焦于金融或个人理财主题。
  • 中文相关语料库(第3.6节和第3.7节)的每句平均词数最长,可能是因为中文文本缺乏词边界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。