Skip to main content
QUICK REVIEW

[論文レビュー] Problems with automating translation of movie/TV show subtitles

Prabhakar Gupta, Mayank Sharma|arXiv (Cornell University)|Sep 4, 2019
Natural Language Processing Techniques参考文献 24被引用数 7
ひとこと要約

この論文は、機械翻訳(MT)を用いた映画およびテレビドラマの字幕翻訳を自動化する際の27の主要な課題を特定し、それらをテクスト翻訳の問題、字幕フォーマットガイドライン違反、MTエンジンの適応性問題の3つに分類している。ニューラル機械翻訳の進展にもかかわらず、システムは文化的なニュアンス、語順、フォーマットの面で依然として顕著な誤りを生じており、多言語ストリーミングプラットフォームへの信頼できる導入には、後処理または特化したモデルの導入が不可欠である。

ABSTRACT

We present 27 problems encountered in automating the translation of movie/TV show subtitles. We categorize each problem in one of the three categories viz. problems directly related to textual translation, problems related to subtitle creation guidelines, and problems due to adaptability of machine translation (MT) engines. We also present the findings of a translation quality evaluation experiment where we share the frequency of 16 key problems. We show that the systems working at the frontiers of Natural Language Processing do not perform well for subtitles and require some post-processing solutions for redressal of these problems

研究の動機と目的

  • 機械翻訳を用いた映画およびテレビドラマの字幕翻訳における繰り返し発生する問題を体系的に特定・分類すること。
  • 6つの言語対(英語→ドイツ語、中国語、フランス語、スペイン語、アラビア語、ポルトガル語)における主な翻訳誤りの頻度と深刻度を評価すること。
  • 分野の進展にもかかわらず、最新のNLPおよびニューラルMTシステムが、字幕固有の課題に対して依然として性能を発揮していないことを示すこと。
  • 生産運用に耐える自動字幕翻訳を実現するには、言語別および誤り別に特化した後処理またはモデル改善の必要性を強調すること。

提案手法

  • 56部の映画ファイルから人間が作成した英語字幕を17,977ブロック収集。
  • [6]で訓練されたニューラル機械翻訳(NMT)システムを用いて、6か国語への自動翻訳を生成。
  • プロフェッショナルな翻訳者が16の事前に定義された問題の有無について各字幕ブロックをアノテートした検証実験を実施。
  • 問題を3つのカテゴリーに分類:テクスト翻訳誤り、字幕ガイドライン違反、MT適応性問題。
  • 全字幕ブロックを対象に、言語対ごとの誤り頻度をパcent(パーセント)ベースの指標で定量評価。
  • 各問題タイプごとにアノテート済みの例を提示し、現実のMT失敗事例を文脈の中で可視化。

実験結果

リサーチクエスチョン

  • RQ1現在のNMTシステムを用いた字幕翻訳の自動化において、最も頻発し影響が大きい問題は何か?
  • RQ2ドイツ語やアラビア語のような語形変化が豊富または文化的にニュアンスが複雑な言語では、誤り頻度がどのように変動するか?
  • RQ3ジャンル、文化的な参照、架空の言語の有無が、字幕翻訳におけるMTのパフォーマンスにどの程度影響を及えるか?
  • RQ4スペースの不正、複合語の処理、フォーマット誤りといったガイドライン違反が、読みやすさや理解度にどのように影響を及えるか?
  • RQ5後処理またはモデルの最適化によって、字幕翻訳における最も一般的なMT誤りを効果的に是正できるか?

主な発見

  • 意味の保持に失敗する言い換え誤りが、中国語(簡体字を除く)を除く全言語対で最も頻発しており、意味的保持の問題が根本的であることを示している。
  • ドイツ語翻訳では構造的・語順的誤りが最も頻発し、複雑な名詞句や語順ルールの処理に課題があることを示している。
  • フォーマット誤り(特にフィートからメートルへの単位換算ミスや数値表記の不統一)が顕著で、ドイツ語およびフランス語翻訳で特に顕著だった。
  • 括弧や標点など非テキスト文字の翻訳誤りが、中国語およびアラビア語で最も頻発しており、トークン化および文字セット固有の課題が示唆された。
  • 語彙的翻訳誤りがドイツ語、スペイン語、アラビア語で深刻な問題となっており、慣用句や文脈依存語彙の処理が不十分であることを示している。
  • 最新のNMTでさえ、繰り返し表現の処理、複合語の形成、文化的ニュアンスの扱いといった、字幕固有の核心的課題を解決できていない。これには、後処理またはドメイン特化した適応が不可欠である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。