Skip to main content
QUICK REVIEW

[论文解读] Fluency Over Adequacy: A Pilot Study in Measuring User Trust in Imperfect MT

Marianna J. Martindale, Marine Carpuat|arXiv (Cornell University)|Feb 16, 2018
Natural Language Processing Techniques被引用 15
一句话总结

本初步研究通过受控调查实验,探究了机器翻译中的流利度与恰当性错误如何影响用户信任。结果显示,用户对流利度问题的敏感度显著高于对恰当性错误的敏感度,表明即使内容准确,不流利的翻译也会更严重地损害信任。

ABSTRACT

Although measuring intrinsic quality has been a key factor in the advancement of Machine Translation (MT), successfully deploying MT requires considering not just intrinsic quality but also the user experience, including aspects such as trust. This work introduces a method of studying how users modulate their trust in an MT system after seeing errorful (disfluent or inadequate) output amidst good (fluent and adequate) output. We conduct a survey to determine how users respond to good translations compared to translations that are either adequate but not fluent, or fluent but not adequate. In this pilot study, users responded strongly to disfluent translations, but were, surprisingly, much less concerned with adequacy.

研究动机与目标

  • 探究用户在接触到流利但不恰当的翻译,或恰当但不流利的翻译时,如何调节其对机器翻译的信任。
  • 比较流利度与恰当性错误对用户信任在机器翻译系统中影响的相对大小。
  • 开发一种基于调查的用户信任测量方法,聚焦于真实世界用户经验,而非内在质量指标。
  • 通过识别最显著影响用户信心与系统采纳的错误类型,为机器翻译开发提供指导。
  • 强调在机器翻译研究中需要引入信任感知的评估方法,超越传统的BLEU或METEOR等指标。

提出的方法

  • 开展了一项受控的在线调查,参与者被暴露于一系列机器翻译输出。
  • 向参与者展示了三种类型的翻译:流利且恰当、流利但不恰当(不流畅)、恰当但不流利(不恰当)。
  • 使用五段落序列模拟真实世界中的暴露情境,每段翻译后测量信任度。
  • 在每段翻译后,以100分为尺度收集信任评分,并随后展示参考翻译以验证理解。
  • 分析不同翻译类型下的信任响应,比较流利度与恰当性错误的影响。
  • 通过每位参与者的z得分标准化信任评分,以校正个体评分偏差。

实验结果

研究问题

  • RQ1与流利且恰当的翻译相比,用户在接触到流利但不恰当的翻译时,其信任度如何变化?
  • RQ2与高质量翻译相比,用户在接触到恰当但不流畅的翻译时,其信任度如何变化?
  • RQ3在机器翻译中,哪种错误类型——流利度或恰当性——对用户信任的影响更强?
  • RQ4当用户暴露于混合质量的翻译时,其信任度是趋于稳定还是波动?
  • RQ5在未看到参考翻译的情况下,用户在多大程度上能识别出具有误导性的翻译?

主要发现

  • 用户对不流畅翻译的反应远强于对不恰当翻译的反应,表明流利度对信任的影响大于恰当性。
  • 尽管在以往的WMT评估中流利度与恰当性高度相关,但本研究中的用户在信任感知上表现出对流利度的明确偏好,而非恰当性。
  • 信任水平在几轮优质翻译后趋于稳定,表明用户可能在早期形成判断并长期保持。
  • 参与者在未看到参考翻译时更难察觉不恰当性,表明具有误导性的翻译可能不易被察觉。
  • 研究发现,用户更信任流利但不准确的翻译,而非不流畅但准确的翻译,凸显了对流利但错误输出产生隐性信任的风险。
  • 结果表明,由于流利度的掩盖效应,WMT中的恰当性评分可能更多地充当整体质量指标,而非真正的内容准确性度量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。