Skip to main content
QUICK REVIEW

[論文レビュー] Predicting Actions to Help Predict Translations

Zixiu Wu, Julia Ive|arXiv (Cornell University)|Aug 5, 2019
Natural Language Processing Techniques参考文献 18被引用数 8
ひとこと要約

本稿では、動画からのアクション固有の視覚的特徴を活用することで、特に動画の行動動詞がマスキングされた状態で劣化した元文書の翻訳品質を向上させるトランスフォーマー基盤のマルチモーダル機械翻訳モデルを提案する。結果は、動画行動認識ネットワークからの視覚的特徴が、マスキングされた状況での性能を顕著に向上させることを示しており、人的評価により、動詞関連の視覚的埋め込みを用いたモデルは、テキストのみのベースラインよりもより正確で自然な翻訳を生成することが確認された。

ABSTRACT

We address the task of text translation on the How2 dataset using a state of the art transformer-based multimodal approach. The question we ask ourselves is whether visual features can support the translation process, in particular, given that this is a dataset extracted from videos, we focus on the translation of actions, which we believe are poorly captured in current static image-text datasets currently used for multimodal translation. For that purpose, we extract different types of action features from the videos and carefully investigate how helpful this visual information is by testing whether it can increase translation quality when used in conjunction with (i) the original text and (ii) the original text where action-related words (or all verbs) are masked out. The latter is a simulation that helps us assess the utility of the image in cases where the text does not provide enough context about the action, or in the presence of noise in the input text.

研究の動機と目的

  • 動画からの視覚的特徴が、特に行動関連の動詞に対してマルチモーダル機械翻訳を向上させられるかどうかを調査すること。
  • 元のテキストに行動動詞をマスキングすることで、低リソースまたはノイズの多い翻訳状況を模擬し、視覚モodalがその有効性を評価すること。
  • 翻訳支援に役立つ視覚的特徴表現の違い—行動認識特徴、CNN活性化、語彙埋め込み—を比較すること。
  • 視覚的特徴が、クリーンな入力とマスキングされた入力の間の性能格差を埋めるのを支援するかどうかを同定すること。
  • 自動評価指標と人的評価を照合し、特に動詞がマスキングされた状況における翻訳品質の観点から、翻訳品質の評価を検証すること。

提案手法

  • 本研究では、視覚的特徴とテキスト符号化を統合するトランスフォーマー基盤のアーキテクチャを用いてマルチモーダル機械翻訳を実装する。
  • 視覚的特徴は、3つの方法で動画クリップから抽出される:行動認識に微調整された3D ResNeXt-101モデル(videosum)、3D ResNet-50の最終畳み込み層(conv4)、および動詞分類モデルからの語彙埋め込み(AIF-emb)。
  • How2データセットが使用され、2つのマスキング戦略が採用される:行動動詞のみをマスキングする(ACT)と、すべての動詞をマスキングする(ALL)、ノイズの多いまたは不完全な入力を模擬する。
  • バイトペアエンコーディング(BPE)が、元のテキスト、ACTマスキング済み、ALLマスキング済み、およびターゲット言語のテキストに対して個別に適用され、4つの異なる語彙が生成される。
  • アブレーションスタディでは、視覚的不整合性を導入することで視覚的特徴の影響をテストする—実際の動画特徴をランダムな特徴に置き換えることで、性能向上が意味的な視覚的整合性に起因していることを確認する。
  • 人的評価では、ポルトガル語話者が150件のテストサンプルについて、テキストのみ、AIF-conv4、AIF-embモデルの翻訳をペairワイズの好みスコアリング方式で順位付けする。

実験結果

リサーチクエスチョン

  • RQ1元のテキストに行動動詞がマスキングされた状況で、動画からの視覚的特徴が翻訳品質を向上させられるか?
  • RQ2行動認識出力、CNN活性化、動詞埋め込みといった異なる種類の視覚的特徴は、マルチモーダル翻訳において異なる有効性を示すか?
  • RQ3視覚的特徴による性能向上は、マスキングされた状況(ACTおよびALL)において、元の状態(ORG)よりも顕著に現れるか?
  • RQ4視覚モダリティが、文脈が欠落した場合に特に顕著な性能格差(ORGとマスキング済み)を埋めるのを支援するか?
  • RQ5自動評価指標は、特に動詞がマスキングされた状況において、人的評価による翻訳品質の認識と一致するか?

主な発見

  • 動詞関連の視覚的特徴を語彙埋め込みから得るAIF-embモデルは、人間の好みスコアが最も高く(0.81)なった。テキストのみ(0.75)やAIF-conv4(0.73)を上回った。
  • 動画行動認識ネットワーク(videosum)からの視覚的特徴は、自動翻訳性能が最も高く、特にマスキングされた状況で顕著な向上を示した。ALLマスキング設定では、テキストのみのモデルに比べて0.4 BLEUポイントの向上を達成した。
  • 不整合なデコード実験では、視覚的特徴が不一致になると1.0 BLEUポイントの低下が確認され、マルチモーダルモデルが視覚入力を意味的に活用していることが裏付けられた。
  • 自動評価指標の改善は顕著であったが、テキストのみのモデルとマルチモーダルモデルとの間のBLEUスコアの差はわずか0.2〜0.4ポイントに留まり、性能向上は微細ではあるが意味のあるものであった。
  • 人的評価では、AIF-embモデルが、動詞がマスキングされた状況において、テキストのみのモデルよりもよりスムーズで意味的に正確な翻訳を生成することが判明した。これは、視覚的特徴が意味的回復を支援していることを示唆している。
  • ORGとACTの間の性能格差は、視覚的特徴によって顕著に縮小されなかった。これは、視覚的入力のみでは、元のテキストに存在する行動動詞が欠落した場合の補填が完全には不可能であることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。