[論文レビュー] Pushing the Limits of Paraphrastic Sentence Embeddings with Millions of Machine Translations
本稿では、大規模な平行コーパスの逆翻訳により生成された5100万件の英語-英語の並び替え文ペアからなる、ParaNMT-50Mというデータセットを紹介する。このコーパスを用いて、著者らは意味的類似性を捉える能力が、SemEval STSベンチマークで先行するすべての教師ありシステムを上回り、多様なテキストスタイルや構造をカバーする分野で最先端の性能を達成する並び替え文埋め込みを訓練した。
We extend the work of Wieting et al. (2017), back-translating a large parallel corpus to produce a dataset of more than 51 million English-English sentential paraphrase pairs in a dataset we call ParaNMT-50M. We find this corpus to be cover many domains and styles of text, in addition to being rich in paraphrases with different sentence structure, and we release it to the community. To show its utility, we use it to train paraphrastic sentence embeddings using only minor changes to the framework of Wieting et al. (2016b). The resulting embeddings outperform all supervised systems on every SemEval semantic textual similarity (STS) competition, and are a significant improvement in capturing paraphrastic similarity over all other sentence embeddings We also show that our embeddings perform competitively on general sentence embedding tasks. We release the corpus, pretrained sentence embeddings, and code to generate them. We believe the corpus can be a valuable resource for automatic paraphrase generation and can provide a rich source of semantic information to improve downstream natural language understanding tasks.
研究の動機と目的
- 複数の分野やテキストスタイルをカバーする大規模で多様性に富み、高品質な並び替え文データセットの作成。
- 既存の教師あり手法を上回る性能で、並び替え文類似性を捉える文埋め込みの性能向上。
- 人為的アノテーションなしに、大規模な並び替え文データを生成するためのバックトランスレーションの有効性の実証。
- 自動並び替え文生成および下流のNLUタスクを支援するリソースの公開。
提案手法
- 大規模な平行単語彙コーパスのバックトランスレーションにより、合成された英語-英語の並び替え文ペアを生成。
- Wietingら (2016b) のフレームワークをわずかに修正して、並び替え文埋め込みを訓練。
- 得られた5100万件の並び替え文ペアを用いて、大規模かつ多様なテキスト分布で文埋め込みを事前学習。
- 同じ訓練手順を適用することで、並び替え文タスクおよび一般文埋め込みタスクの両方で優れた性能を達成。
- ParaNMT-50Mデータセット全体、事前学習済み埋め込み、および再現性やコミュニティ利用を目的としたコードの公開。
実験結果
リサーチクエスチョン
- RQ1大規模な平行コーパスのバックトランスレーションにより、強固な文埋め込みの訓練に適した高品質で大規模な並び替え文データセットを生成できるか?
- RQ2ParaNMT-50Mで訓練された文埋め込みの性能は、意味的テキスト類似性タスクにおいて、既存の教師ありシステムと比べてどうなるか?
- RQ3ParaNMT-50Mに含まれるテキストスタイルや分野の多様性が、文埋め込みの一般化性能にどの程度寄与するか?
- RQ4提案された埋め込みは、並び替え文タスク以外の一般文埋め込みベンチマークでも競争力のある性能を示せるか?
主な発見
- ParaNMT-50Mデータセットには、5100万件を超える英語-英語の並び替え文ペアが含まれており、多様な分野やテキストスタイルをカバーしている。
- ParaNMT-50Mで訓練された文埋め込みは、SemEval STSコンペティションのすべてのタスクで、すべての先行する教師ありシステムを上回っている。
- 他のすべての文埋め込みモデルと比較して、並び替え文類似性を捉える能力が顕著に向上している。
- 一般文埋め込みタスクにおいても、競争力のある性能を示しており、広範な適用可能性を示している。
- データセット、事前学習済み埋め込み、コードの公開により、並び替え文生成および下流のNLUアプリケーションにおける広範な利用が可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。