[論文レビュー] Lattice Transformer for Speech Translation
本稿では、自動音声認識(ASR)から得られる語彙格子を処理できる制御可能な格子注意機構を備えた格子変換器(lattice transformer)を提案する。標準的な変換器を拡張し、前方、後方、周辺確率スコアを統合する。この手法は、LDCスペイン語-英語コーパスでは標準変換器および格子LSTMを最大1.5 BLEUポイント、WMT 2017中国語-英語では0.55 BLEUポイント上回る、音声翻訳およびテキスト翻訳タスクにおける翻訳性能を顕著に向上させる。
Recent advances in sequence modeling have highlighted the strengths of the transformer architecture, especially in achieving state-of-the-art machine translation results. However, depending on the up-stream systems, e.g., speech recognition, or word segmentation, the input to translation system can vary greatly. The goal of this work is to extend the attention mechanism of the transformer to naturally consume the lattice in addition to the traditional sequential input. We first propose a general lattice transformer for speech translation where the input is the output of the automatic speech recognition (ASR) which contains multiple paths and posterior scores. To leverage the extra information from the lattice structure, we develop a novel controllable lattice attention mechanism to obtain latent representations. On the LDC Spanish-English speech translation corpus, our experiments show that lattice transformer generalizes significantly better and outperforms both a transformer baseline and a lattice LSTM. Additionally, we validate our approach on the WMT 2017 Chinese-English translation task with lattice inputs from different BPE segmentations. In this task, we also observe the improvements over strong baselines.
研究の動機と目的
- 自動音声認識(ASR)から得られる格子構造の入力をネイティブに処理できるように、変換器アーキテクチャを拡張すること。
- ASR格子からの周辺確率スコア(前方、後方、周辺)を注意機構に統合し、不確実性をモデル化し、耐性を高めること。
- 音声翻訳およびテキスト翻訳タスクの両方を扱える汎用フレームワークを構築すること。
- 低リソースおよび高不確実性状況において、格子に注意を払う注意機構が、標準変換器および格子LSTMを上回ることを示すこと。
- 確率スコアが利用できない場合に、標準変換器に還元可能であることを示して、モデルの柔軟性を検証すること。
提案手法
- 相対的位置埋め込みを用いて格子のトポロジーを符号化する格子相対的位置注意機構を提案し、共有パス上のトークンに限定して注意を制限する。
- ASR格子からの前方、後方、周辺確率スコアを学習可能な注意重みとして統合し、不確実性を考慮した注意計算を可能にする。
- 格子スコアに基づいて動的に注意を調整する制御可能な注意機構を設計し、格子情報の柔軟な統合を可能にする。
- 標準的な変換器エンコーダおよびデコーダを格子注意機構を用いて変更し、格子入力に対するエンドツーエンド学習を可能にする。
- BPEベースの複数の分割から得た格子を用いて、音声翻訳(LDCスペイン語-英語)およびテキスト翻訳(WMT 2017中国語-英語)の両方でモデルを学習する。
- 微調整およびアブレーションスタディを用いて、格子変換器アーキテクチャにおける各スコアタイプおよびモジュールの寄与度を分析する。
実験結果
リサーチクエスチョン
- RQ1変換器ベースのモデルは、1-best仮説に限定されず、ASRシステムから得られる格子構造の入力を効果的に処理できるか?
- RQ2ASR格子からの前方、後方、周辺確率スコアは、注意計算および翻訳性能にどのように影響するか?
- RQ3格子構造と不確実性を統合することで、標準変換器および格子LSTMと比較して翻訳品質が向上するか?
- RQ4格子変換器は、BPE分割から得たサブワード格子入力に対してもテキスト翻訳タスクに一般化可能か?
- RQ5注意機構における異なる格子スコア(周辺、前方、後方)の相対的寄与度は何か?
主な発見
- LDCスペイン語-英語音声翻訳データセットでは、格子変換器は標準変換器を1.5 BLEUポイント、格子LSTMを1.2 BLEUポイント上回る。
- 周辺スコアが最も顕著な性能向上に寄与しており、エンコーダおよびデコーダでの併用が最大の向上をもたらす。
- WMT 2017中国語-英語テキスト翻訳タスクでは、格子変換器は24.81 BLEUを達成し、ベーシックな変換器(24.26)を上回り、より大きなサイズの変換器-bigモデル(24.20)と同等の性能を、ベーシックサイズのアーキテクチャで達成した。
- 格子入力から学習を開始すると、微調整よりも高速に収束し、より高い性能を達成する。これは、格子構造が強いインダクティブバイアスを提供していることを示唆する。
- モデルはテキスト翻訳タスクにも良好に一般化され、BPE分割から得た格子入力が、音声入力がなくても翻訳品質を向上させられることを示した。
- 注意可視化により、モデルが曖昧または低信頼度領域でより妥当な格子パスに注目するよう学習していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。