Skip to main content
QUICK REVIEW

[論文レビュー] Denoising Pre-Training and Data Augmentation Strategies for Enhanced RDF Verbalization with Transformers

Sébastien Montella, Betty Fabre|arXiv (Cornell University)|Dec 1, 2020
Topic Modeling参考文献 41被引用数 6
ひとこと要約

本稿では、外部コーパス(Wikipediaおよび自作データセット)を用いたノイズ除去事前学習およびデータ拡張戦略を提案し、Transformerを用いたRDFの自然言語化を向上させる。大規模なノイズありテキストおよび拡張されたRDFトリプルで事前学習することで、未学習のエンティティでは相対BLEUスコアが126.05%向上し、未学習のカテゴリでは88.16%向上する。これは、分布外データへの強い一般化性能を示している。

ABSTRACT

The task of verbalization of RDF triples has known a growth in popularity due to the rising ubiquity of Knowledge Bases (KBs). The formalism of RDF triples is a simple and efficient way to store facts at a large scale. However, its abstract representation makes it difficult for humans to interpret. For this purpose, the WebNLG challenge aims at promoting automated RDF-to-text generation. We propose to leverage pre-trainings from augmented data with the Transformer model using a data augmentation strategy. Our experiment results show a minimum relative increases of 3.73%, 126.05% and 88.16% in BLEU score for seen categories, unseen entities and unseen categories respectively over the standard training.

研究の動機と目的

  • WebNLGベンチマークにおいて、特に分布外のエンティティや述語に対するRDFからテキストへの生成性能を向上させること。
  • 訓練中に見られなかった未学習のエンティティやカテゴリに直面した際の、従来モデルの一般化性能の低さを是正すること。
  • 知識ベースの自然言語化における、外部コーパスを用いたノイズ除去事前学習およびデータ拡張戦略の有効性を調査すること。
  • カリキュラム学習および事前学習戦略が、RDF自然言語化におけるゼロショットおよびフェイワショット一般化に与える影響を評価すること。

提案手法

  • Wikipediaから得たWS1および自作のトリプル抽出パイプラインから得たST1の2つの外部データセットを構築し、訓練データを拡張した。
  • 外部コーパスから抽出したノイズあり文を用いて、ノイズ除去オートエンコーダーの事前学習を実施し、モデルの耐障害性および言語的一般化性能を向上させた。
  • 2段階の訓練パイプラインを採用:外部データでの事前学習の後、WebNLGデータセットでの微調整。
  • 微調整段階でカリキュラム学習を適用し、段階的に訓練の難易度を上げたが、予想に反して性能低下が見られた。
  • 事前学習とデータ拡張を組み合わせることで、未学習のエンティティおよび述語に対するモデルの一般化性能を向上させた。
  • ノイズ除去目的関数を用いたTransformerベースのシーケンス・トゥ・シーケンスモデルを訓練し、複数の指標(BLEU、METEOR、chrF++、BLEURT)を用いて評価した。

実験結果

リサーチクエスチョン

  • RQ1大規模なノイズありテキストにおけるノイズ除去事前学習は、未学習のエンティティおよびカテゴリにおけるRDF自然言語化性能の向上に寄与するか?
  • RQ2外部コーパスを用いたデータ拡張は、RDFからテキストへの生成における一般化性能にどのように影響するか?
  • RQ3微調整段階でのカリキュラム学習は、分布外データに対するゼロショット性能を向上させるか?
  • RQ4類似したタスクで先行して成功を収めたにもかかわらず、本設定ではカリキュラム学習が性能低下を引き起こす理由は何か?
  • RQ5知識ベース自然言語化の事前学習において、データ品質とデータ量の相対的影響は何か?

主な発見

  • 標準的な訓練と比較して、未学習のエンティティでは相対BLEUスコアが126.05%向上し、分布外エンティティへの強い一般化性能が示された。
  • 未学習のカテゴリでは、相対BLEUスコアが88.16%向上し、訓練時に見られなかった新しい述語の処理にも効果的に対応していることが示された。
  • WS1よりも5倍小さいST1データセットでのみ事前学習を行った場合でも、両方を併用した場合よりも高い性能を示した。これは、データの品質と代表性が単なる量よりも重要であることを示唆している。
  • ノイズ除去事前学習とST1での事前学習を組み合わせた場合、入力分布の不一致(ノイズ除去目的関数とRDFトリプルの線形化との間)が原因で性能が悪化した可能性がある。
  • 最も優れた性能を示したモデルは、カリキュラム学習を用いずにWS1とST1の両方で訓練されたもので、生成テキストの文の流れと情報統合性に優れていた。
  • 人的評価では、学習済みカテゴリでは競争力のある性能を示したが、未学習データでは順位が低く、ゼロショット一般化の面でさらなる改善の余地があることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。