Skip to main content
QUICK REVIEW

[論文レビュー] A Lexicalist Approach to the Translation of Colloquial Text

Fred Popowich, Davide Turcato|ArXiv.org|Jun 18, 1997
Natural Language Processing Techniques参考文献 11被引用数 20
ひとこと要約

本稿では、テレビの字幕付き放送からスペイン語およびブラジルポルトガル語への口語的英語の翻訳を目的とした、シェイクアンドベイク(S&B)パラダイムに基づく語彙主義的機械翻訳システムを提示する。このシステムは、浅い解析と語彙的転送ルールを用いて、短く不文法的で慣用的表現を含む発話に対して堅牢に処理を行い、評価では66.27%の翻訳が受容可能または正しい結果を示した。視覚的文脈のおかげで意味的不正確さにもかかわらず理解が促進された。

ABSTRACT

Colloquial English (CE) as found in television programs or typical conversations is different than text found in technical manuals, newspapers and books. Phrases tend to be shorter and less sophisticated. In this paper, we look at some of the theoretical and implementational issues involved in translating CE. We present a fully automatic large-scale multilingual natural language processing system for translation of CE input text, as found in the commercially transmitted closed-caption television signal, into simple target sentences. Our approach is based on the Whitelock's Shake and Bake machine translation paradigm, which relies heavily on lexical resources. The system currently translates from English to Spanish with the translation modules for Brazilian Portuguese under development.

研究の動機と目的

  • 字幕付きテレビ放送に見られる、短く不文法的で慣用的表現を含む口語的英語の翻訳という課題に対処すること。
  • 文法的・意味的解析を最小限に抑えた、完全自動で大規模な多言語NLPシステムを構築すること。
  • 翻訳の完璧な正確性を最優先せず、放送からの視覚的および文脈的手がかりを活用して翻訳の不完全さを補完すること。
  • 言語固有の文法と語彙のモジュール化により、新たなターゲット言語への迅速な拡張を可能にすること。

提案手法

  • システムは、語彙的リソースに依存し、深い文法的・意味的解析を避ける、シェイクアンドベイク(S&B)機械翻訳フレームワークを採用する。
  • 入力文は、不文法的または断片的な発話を構造的に把握できるように浅い解析が施され、ターゲット言語の構造へのマッピングを可能にする。
  • 語彙的転送ルールにより、ソース言語の語の集合と文法的特徴が、対応するターゲット言語の語の集合および構造に変換され、語の順序と文法的機能が保持される。
  • 言語固有の文法と語彙が、ターゲット言語の正しい構文的表現を生成するために使用され、スペイン語用モジュールは既に実装済みで、ブラジルポルトガル語用は開発中である。
  • 括弧書き、呼応語、感嘆詞は別個に処理され、翻訳結果は母語話者言語の慣習に従って配置される。
  • 評価では人間による翻訳の受容性を判断し、結果を「正しい(yes)」「受容可能だが理想的ではない(ok)」「受容できない(no)」の3段階に分類する。

実験結果

リサーチクエスチョン

  • RQ1字幕付きテレビ放送に見られる、口語的で不文法的・慣用的表現を含む発話の文法的・意味的不規則性を、機械翻訳システムがどのように効果的に処理できるか。
  • RQ2浅い解析と語彙的転送に依存する語彙主義的アプローチが、非公式で断片的な発話に対してどの程度受容可能な翻訳性能を達成できるか。
  • RQ3リアルタイムでマルチモーダルな環境下で、放送からの視覚的および文脈的情報が翻訳の不正確さをどの程度補完できるか。
  • RQ4シェイクアンドベイクフレームワークは、低リソースで高耐障害性を求める環境において、多言語展開に効果的にスケーリングされ、モジュール化できるか。
  • RQ5入力が本質的に曖昧で文脈依存性が高い分野において、翻訳の正確性と耐障害性の間にはどのようなトレードオフが生じるか。

主な発見

  • システムは、正しい翻訳または受容可能な翻訳の合計で66.27%を達成し、うち38.46%が正しいと分類され、27.81%が受容可能だが理想的ではないとされた。
  • 約84.5%の文がS&Bアプローチで翻訳可能であり、入力ドメインへの高いカバレッジを示している。
  • 「how you doing?」のような不文法的で慣用的な表現を自然なスペイン語「qué tal está?」に正確に翻訳するなど、語彙的マッピングの堅牢性が確認された。
  • 「strangled」を受動態として扱うべきところを「estranguló」(能動態)に翻訳する意味的不正確さが見られたが、視覚的文脈のおかげで翻訳の受容性は保たれた。
  • 「bag all the stuff on the bedside table?」 や 「that’s the only one i need.」 といった複雑または曖昧なフレーズ表現では、システムの処理に限界が見られた。
  • モジュラー設計により、スペイン語用モジュールの開発が効率的に行われ、ブラジルポルトガル語用の開発も進行中であり、追加言語への迅速な展開が可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。