[論文レビュー] Identifying Computer-Translated Paragraphs using Coherence Features
本稿では、品詞(POS)語照合から導出された一貫性特徴を用いて、コンピュータ翻訳文を段落レベルで検出する手法を提案する。POSMatおよびMatPenのメトリクスを導入し、段落一貫性スコア(ParaCoh)を計算することで、ドイツ語において72.3%の精度と29.8%の等誤差率(EER)を達成し、翻訳および論文生成検出の両タスクで先行手法を上回った。
We have developed a method for extracting the coherence features from a paragraph by matching similar words in its sentences. We conducted an experiment with a parallel German corpus containing 2000 human-created and 2000 machine-translated paragraphs. The result showed that our method achieved the best performance (accuracy = 72.3%, equal error rate = 29.8%) when it is compared with previous methods on various computer-generated text including translation and paper generation (best accuracy = 67.9%, equal error rate = 32.0%). Experiments on Dutch, another rich resource language, and a low resource one (Japanese) attained similar performances. It demonstrated the efficiency of the coherence features at distinguishing computer-translated from human-created paragraphs on diverse languages.
研究の動機と目的
- コンピュータ翻訳段落は人間が書いたものと比べて一貫性が低くなる傾向があるため、その識別に課題を提示する。
- 段落レベルの一貫性特徴が、機械翻訳文と人間作成文を効果的に区別できるかどうかを調査する。
- 単語の類似性と文間の構造的関係を活用して、一貫性を定量化する手法を開発する。
- ドイツ語(高リソース)、オランダ語(高リソース)、日本語(低リソース)を含む多様な言語で、この手法を評価する。
- 翻訳文における一貫性の欠落を特定することで、機械翻訳の品質向上を支援する。
提案手法
- 品詞ペアを用いて、段落内の文間で類似する語を特定・スコア化するPOSベースの語照合メトリクス、POSMatを提案する。
- 一致しないまたは不一致の語ペアの影響を軽減するため、マッチングペナルティメトリクスMatPenを導入する。
- POSMatとMatPenを統合し、段落全体の一貫性を測定する統一された段落一貫性スコア、ParaCohを構築する。
- ParaCoh特徴に基づいてトレーニングされた線形分類器(LINEAR)を用い、段落を人間作成または機械翻訳文に分類する。
- 平行コーパスを用いる:2000件の英語TEDトーク段落(人間作成)とそれに対応するドイツ語翻訳版。機械翻訳版はGoogle Translateを用いて生成した。
- オランダ語(高リソース)および日本語(低リソース)に対しても、同様の平行段落コレクションを用いて評価を拡張する。
実験結果
リサーチクエスチョン
- RQ1段落レベルの一貫性特徴は、機械翻訳文と人間作成文を効果的に区別できるか?
- RQ2文レベルやドキュメントレベルの特徴と比較して、POS照合語ペアに基づく一貫性特徴は、機械翻訳の検出にどの程度有効か?
- RQ3ドイツ語、オランダ語、日本語のようにリソースレベルが異なる言語間で、本手法は一般化可能か?
- RQ4特定の品詞ペア(例:VB-VBG、VBG-RB)は、翻訳アーティファクトを区別するうえでどの程度寄与するか?
- RQ5ParaCohメトリクスは、多様な言語的文脈において、機械翻訳品質の信頼できる代理指標として機能できるか?
主な発見
- 提案手法のParaCohベースのアプローチは、ドイツ語の平行段落において72.3%の精度と29.8%の等誤差率(EER)を達成し、類似の検出タスクにおいて先行手法(67.9%の精度、32.0%のEER)を上回った。
- オランダ語(高リソース言語)においても、ドイツ語と同等の性能を達成し、優れた言語間一般化性を示した。
- 日本語(低リソース言語)においては、ドイツ語およびオランダ語よりも高い性能を達成しており、低リソース環境における潜在的な利点を示唆した。
- 検出に最も効果的な品詞ペアはVB-VBG(63.7%の精度)、VBG-RB(63.6%)、VBG-NN(63.5%)であり、動詞および副詞的語ペアが翻訳アーティファクトの強力な指標であると示された。
- 文書レベルの分布ベースの検出器(LabbéとLabbé, 2013)は、翻訳文における語の分布が同期しているため、全言語で最も悪い性能を示したが、本手法は著しくそれを上回った。
- ParaCoh特徴に基づくLINEAR分類器が、全体で最高の性能を示し、一貫性メトリクスが判別的特徴として有効であることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。