Skip to main content
QUICK REVIEW

[論文レビュー] CrossMap Transformer: A Crossmodal Masked Path Transformer Using Double Back-Translation for Vision-and-Language Navigation

Aly Magassouba, Komei Sugiura|arXiv (Cornell University)|Mar 1, 2021
Multimodal Machine Learning Applications参考文献 27被引用数 6
ひとこと要約

本論文は、言語指示からナビゲーション経路を生成し、予測された経路から指示を再構築するための二重バックトランスレーション(DBT)機構を用いて、視覚・言語ナビゲーションを共同で学習する、CrossMap Transformer(CMT)を提案する。経路生成器とスピーカーネットワークの間で潜在的特徴を共有することにより、クロスモodalな整合性が向上し、R2Rベンチマークにおいて最先端のLSTMベース手法と同等の性能を達成した。

ABSTRACT

Navigation guided by natural language instructions is particularly suitable for Domestic Service Robots that interacts naturally with users. This task involves the prediction of a sequence of actions that leads to a specified destination given a natural language navigation instruction. The task thus requires the understanding of instructions, such as ``Walk out of the bathroom and wait on the stairs that are on the right''. The Visual and Language Navigation remains challenging, notably because it requires the exploration of the environment and at the accurate following of a path specified by the instructions to model the relationship between language and vision. To address this, we propose the CrossMap Transformer network, which encodes the linguistic and visual features to sequentially generate a path. The CrossMap transformer is tied to a Transformer-based speaker that generates navigation instructions. The two networks share common latent features, for mutual enhancement through a double back translation model: Generated paths are translated into instructions while generated instructions are translated into path The experimental results show the benefits of our approach in terms of instruction understanding and instruction generation.

研究の動機と目的

  • 経路生成器と言語スピーカーネットワークを共同で訓練することで、視覚・言語ナビゲーションの性能を向上させること。
  • 屋内ナビゲーションタスクにおける曖昧で長い言語指示の課題に対処すること。
  • より良いクロスモダリティ特徴学習により、ニューラルモデルと人間水準のナビゲーションの性能差を縮小すること。
  • 二重バックトランスレーションによるデータ拡張を活用して、未観測環境における一般化性能を向上させること。
  • 経路マスキングとクロスモダリティアテンションが、指示と環境の関係をモデル化する上で果たす役割を評価すること。

提案手法

  • CrossMap Transformerは、トランスフォーマーに基づくアーキテクチャを用いて言語的および視覚的特徴を符号化し、順次的にナビゲーション行動を生成する。
  • 訓練中に経路マスキングを適用し、各ステップで関連する視覚的および言語的手がかりに注目するようモデルを促進する。
  • 二重バックトランスレーション(DBT)機構を用いて、CrossMap TransformerとCrossMapスピーカーネットワークを相互監視のもとで共同で訓練する。
  • DBTでは、予測された行動シーケンスが自然言語の指示に翻訳され、生成された指示が行動経路を再構築するために使用され、自己教師付きのループが形成される。
  • 経路生成器とスピーカーネットワーク間で共有される潜在的特徴により、言語理解とナビゲーション方策学習が相互に強化される。
  • 標準的な指標(成功確率(SR)、SPL、オラクル成功確率(OSR))を用いて、Room-to-Room(R2R)データセット上でモデルを訓練および評価する。

実験結果

リサーチクエスチョン

  • RQ1スピーカーネットワークと共同で訓練された場合、トランスフォーマーに基づくアーキテクチャが再帰的ネットワークを上回る性能を示すのか?
  • RQ2二重バックトランスレーションは、言語と視覚的ナビゲーション経路の間のクロスモダリティの整合性をどのように向上させるのか?
  • RQ3経路マスキングは、モデルが関連する環境的および言語的特徴に注目する能力をどの程度向上させるのか?
  • RQ4経路生成器とスピーカーネットワークの共同訓練は、未観測環境における一般化性能を向上させるのか?
  • RQ5標準的なキャプション評価指標とSPICEを比較した場合、視覚・言語ナビゲーションの指示生成品質を評価する上でどちらが優れているのか?

主な発見

  • CMTモデルは、R2Rの学習済みスプリットで成功確率(SR)0.64、未学習スプリットでSR 0.50を達成し、ベースラインのCMT-type1モデル(それぞれSR 0.59および0.48)を上回った。
  • 二重バックトランスレーションの導入により、学習済みスプリットのSPLは0.51(CMT-type1)から0.53に向上し、未学習スプリットでは0.35から0.38に上昇した。
  • アブレーションスタディの結果、経路マスキングとDBTの両方が性能向上に寄与しており、特に未学習環境での一般化性能向上においてDBTが最大の寄与を示した。
  • CMT(BT-only)バージョンは、Speaker-Follower や EnvDrop よりも優れた一般化性能を示し、VLNタスクにおけるトランスフォーマー基盤のデコーダーの利点を裏付けた。
  • 指示生成の面では、CMTはSPICEスコア21.9を達成し、Speaker-Follower(19.2)やCMS-type1(20.9)を上回ったが、BLEU-4とCIDErスコアは低かった。
  • 定性的な分析では、モデルは大多数のケースでランドマーク間の関係を正しくモデル化していたが、複数のテーブルや遠く離れたランドマークのような視覚的に類似した物体に対しては課題が残った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。