[论文解读] Statistical Machine Translation for Indian Languages: Mission Hindi
本论文提出后缀分离(SS)和复合词拆分(CS)作为统计机器翻译(SMT)从黏着性印度语言(孟加拉语、马拉地语、泰米尔语、泰卢固语)到印地语的预处理技术,显著提升了基线系统的BLEU分数。对于英印翻译,源端重排和因子SMT进一步提升了性能,最佳系统在测试集上达到22.83 BLEU。
This paper discusses Centre for Development of Advanced Computing Mumbai's (CDACM) submission to the NLP Tools Contest on Statistical Machine Translation in Indian Languages (ILSMT) 2014 (collocated with ICON 2014). The objective of the contest was to explore the effectiveness of Statistical Machine Translation (SMT) for Indian language to Indian language and English-Hindi machine translation. In this paper, we have proposed that suffix separation and word splitting for SMT from agglutinative languages to Hindi significantly improves over the baseline (BL). We have also shown that the factored model with reordering outperforms the phrase-based SMT for English-Hindi (\enhi). We report our work on all five pairs of languages, namely Bengali-Hindi (\bnhi), Marathi-Hindi (\mrhi), Tamil-Hindi ( ahi), Telugu-Hindi ( ehi), and \enhi for Health, Tourism, and General domains.
研究动机与目标
- 为解决黏着性印度源语言与印地语在统计机器翻译中的形态差异。
- 通过后缀分离和复合词拆分等预处理技术减少未知词,提升翻译质量。
- 评估这些技术在孟加拉语-印地语、马拉地语-印地语、泰米尔语-印地语、泰卢固语-印地语以及英印语对中的有效性。
- 研究词序和对齐的结构差异,特别是英印翻译中的情况。
- 向ILSMT 2014共享任务提交优化系统,并分析在医疗、旅游和通用领域中的性能表现。
提出的方法
- 通过手动整理的后缀列表,匹配并拆分对应印地语后置词的已知后缀,将后缀分离(SS)应用于源语言词。
- 通过从单语语料库中识别出的高频后缀,递归地将复杂源词分解为形态上有效的成分,实现复合词拆分(CS)。
- 对于英印翻译,应用源端重排以使英语语法与印地语的SOV词序对齐,提升对齐和解码效果。
- 使用短语基于SMT系统作为基线,通过将词干对齐作为对齐因子,进一步利用因子模型改进性能。
- 系统在共享任务数据和单语语料库上进行训练,使用BLEU、NIST和TER指标在开发集和测试集上进行评估。
- 进行错误分析,以识别如专有名词过度拆分或错误拆分导致数据稀疏性降低等问题。
实验结果
研究问题
- RQ1与基线相比,后缀分离是否显著提升黏着性印度语言翻译为印地语的SMT性能?
- RQ2复合词拆分在提升马拉地语和泰卢固语等形态复杂源语言的翻译质量方面,效果如何?
- RQ3源端重排在提升英印SMT的对齐和翻译质量方面有多有效?
- RQ4为何在孟加拉语和马拉地语中,后缀分离与复合词拆分的结合会降低性能?其原因是什么?
- RQ5在英印翻译中,基于词干对齐的因子SMT是否能超越基于重排的系统?
主要发现
- 仅使用后缀分离,孟加拉语-印地语翻译的BLEU从30.16提升至31.73,较基线提升1.57分。
- 在马拉地语-印地语翻译中,后缀分离使BLEU从35.56提升至39.84,提升4.28分,表现出显著有效性。
- 复合词拆分使泰卢固语-印地语翻译的BLEU从16.76提升至20.16,提升3.4分,表明其对高度黏着性语言的价值。
- 在英印翻译中,源端重排使BLEU从18.52提升至22.72,提升4.2分,显示显著影响。
- 结合重排的因子SMT系统达到22.83 BLEU,略高于仅使用重排的系统(22.72),但其他指标更青睐重排系统。
- 最终提交的英印翻译系统采用BL+RO+FACT配置,在测试集上达到22.83 BLEU,为所有评估系统中的最高分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。