[論文レビュー] Translation of Patent Sentences with a Large Vocabulary of Technical Terms Using Neural Machine Translation
本稿では、大量の希少な技術用語を含む日本語・中国語特許文の翻訳を目的としたハイブリッドニューラル機械翻訳(NMT)手法を提案する。翻訳学習中に技術用語をプレースホルダーに置き換えることで、NMTモデルが希少用語に圧倒されず、一般文の構造を学習できる。その後、SMTを用いてこれらのトークンを再翻訳することで、翻訳精度が向上し、ベースラインSMTに対して最大3.1 BLEUおよび2.3 RIBESポイントの向上を達成。同様に、本手法を用いない同等のNMTシステムに対しては0.6 BLEUおよび0.8 RIBESポイントの向上を示した。
Neural machine translation (NMT), a new approach to machine translation, has achieved promising results comparable to those of traditional approaches such as statistical machine translation (SMT). Despite its recent success, NMT cannot handle a larger vocabulary because training complexity and decoding complexity proportionally increase with the number of target words. This problem becomes even more serious when translating patent documents, which contain many technical terms that are observed infrequently. In NMTs, words that are out of vocabulary are represented by a single unknown token. In this paper, we propose a method that enables NMT to translate patent sentences comprising a large vocabulary of technical terms. We train an NMT system on bilingual data wherein technical terms are replaced with technical term tokens; this allows it to translate most of the source sentences except technical terms. Further, we use it as a decoder to translate source sentences with technical term tokens and replace the tokens with technical term translations using SMT. We also use it to rerank the 1,000-best SMT translations on the basis of the average of the SMT score and that of the NMT rescoring of the translated sentences with technical term tokens. Our experiments on Japanese-Chinese patent sentences show that the proposed NMT system achieves a substantial improvement of up to 3.1 BLEU points and 2.3 RIBES points over traditional SMT systems and an improvement of approximately 0.6 BLEU points and 0.8 RIBES points over an equivalent NMT system without our proposed technique.
研究の動機と目的
- 大量の希少で複合的な技術用語を含む特許文書の翻訳という課題に対処すること。
- 特許文書に頻出する未知語(OOV)技術用語を処理できない標準NMTシステムの限界を克服すること。
- NMTのスムーズさとSMTの技術用語処理の正確さを組み合わせることで、日本語・中国語特許文の翻訳品質を向上させること。
- SMTスコアとNMT再スコアリングスコアの平均値を用いて、より高品質な翻訳を選択する再スコアリングおよび再順序付け機構を開発すること。
- 実世界の特許翻訳ベンチマーク上で、従来のSMTおよびベースラインNMTシステムを上回ることを実証すること。
提案手法
- 翻訳学習用の双方向語彙データ内のすべての技術用語を一意の技術用語トークン(TT)に置き換えることで、NMTモデルが希少用語に圧倒されず、一般文の構造を学習できるようにする。
- 非技術的要素のみを翻訳対象とし、技術用語はプレースホルダーとして表現するように、変更された双方向語彙コーパス上でNMTモデルを学習する。
- 学習済みNMTモデルをデコーダーとして用い、依然として技術用語トークンを含む元文の翻訳を生成し、TTを含むトークン列を出力する。
- NMT出力の後処理として、並列フレーズテーブルに基づいてトレーニングされたフレーズベースSMTシステムを用い、各技術用語トークンを対応する翻訳に置き換える。
- SMTの1,000件のベスト翻訳を、SMTスコアとTT付き翻訳文のNMT再スコアリングスコアの平均値で再スコアリングし、最も高いスコアの出力を選択する。
- 本手法を2通りの構成で適用する:SMTによる直接翻訳と、NMTベースの再スコアリングを用いたSMT n-bestリストの再順序付け。
実験結果
リサーチクエスチョン
- RQ1技術用語トークンを用いた語彙削減済み並列コーパスで学習されたNMTシステムは、希少技術用語を含む特許文の翻訳品質を向上させることができるか?
- RQ2SMTベースの技術用語トークンの再翻訳を統合することで、純粋なNMTまたはSMTと比較して全体の翻訳品質がどのように向上するか?
- RQ3SMTのn-best翻訳に対してNMTベースの再スコアリングを適用することで、BLEUおよびRIBES指標の観点から翻訳性能がどの程度向上するか?
- RQ4本手法は、特許文書における複合的な技術用語を処理する面で、ベースラインSMTおよび同等のNMTシステムを上回ることができるか?
- RQ5ハイブリッドNMT-SMTアプローチは、単一の語ではなく、特定の翻訳を持つ複雑な複合語としての未知語技術用語を効果的に処理できるか?
主な発見
- 提案手法のNMTシステムは、日本語・中国語特許文の翻訳において、従来のフレーズベースSMTシステムに対して最大3.1 BLEUポイントおよび2.3 RIBESポイントの顕著な向上を達成した。
- 本手法の技術用語処理技術を用いない同等のNMTシステムと比較して、翻訳性能が約0.6 BLEUポイントおよび0.8 RIBESポイント向上した。
- SMTスコアとNMT再スコアリングスコアの平均値を用いた再順序付けアプローチが、最高のBLEUスコアを達成した。これは、NMTベースの再スコアリングがSMTのn-bestリスト内からより優れた翻訳を的確に特定できることを示している。
- デコーディングアプローチ(SMTによる直接翻訳)が最高のRIBESスコアおよび最も高い人間評価スコアを達成し、より優れたスムーズさと構造的正確性を示している。
- 「laminated wafer」のような複雑な技術用語を、中国語で「laminated wafer」と正しく翻訳した一方、ベースラインシステムは文法的に誤った構造や意味的に不正確な表現を生成した。
- 本手法は、翻訳中に技術用語を単一のユニットとして扱うことで、複雑な多語式技術用語の整合性を効果的に保持しており、個々の要素の誤った分割や翻訳を回避した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。