Skip to main content
QUICK REVIEW

[論文レビュー] MOVER: Mask, Over-generate and Rank for Hyperbole Generation

Yunxiang Zhang, Xiaojun Wan|arXiv (Cornell University)|Sep 16, 2021
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿では、新しい「マスク、過剰生成、ランク付け」パイプラインを用いて、並列データを必要としない非教師付き手法MOVERを提案する。17,862文の英語の誇張表現コーパスであるHYPO-XLを初めて開発し、自動評価および人的評価を通じて、MOVERが意味を保持したまま効果的に誇張表現を生成でき、ベースラインモデルを上回ることを示した。

ABSTRACT

Despite being a common figure of speech, hyperbole is under-researched in Figurative Language Processing. In this paper, we tackle the challenging task of hyperbole generation to transfer a literal sentence into its hyperbolic paraphrase. To address the lack of available hyperbolic sentences, we construct HYPO-XL, the first large-scale English hyperbole corpus containing 17,862 hyperbolic sentences in a non-trivial way. Based on our corpus, we propose an unsupervised method for hyperbole generation that does not require parallel literal-hyperbole pairs. During training, we fine-tune BART to infill masked hyperbolic spans of sentences from HYPO-XL. During inference, we mask part of an input literal sentence and over-generate multiple possible hyperbolic versions. Then a BERT-based ranker selects the best candidate by hyperbolicity and paraphrase quality. Automatic and human evaluation results show that our model is effective at generating hyperbolic paraphrase sentences and outperforms several baseline systems.

研究の動機と目的

  • NLPモデルの学習に用いる大規模な誇張表現テキストデータの不足に対処すること。
  • 並列の対応する意味的文と誇張表現のペアを必要とせずに、意味的文から誇張表現のパラフレーズを生成する非教師付き手法を開発すること。
  • 生成されたテキストにおける意味の保持と誇張の強調のバランスをとること。
  • 3段階のパイプラインを用いて、制御可能で解釈可能で柔軟な誇張表現生成を可能にすること。

提案手法

  • 弱教師付き検索と人的なアノテーションによる精練を用いて、17,862文の非並列な誇張表現文のコーパスであるHYPO-XLを構築する。
  • HYPO-XLの文内のマスクされたスパンに対して、スパン補完を実行するようにBARTを微調整し、学習段階で誇張表現の生成を促進する。
  • 推論段階では、入力の意味的文の一部をマスクし、微調整済みのBARTモデルを用いて複数の誇張表現バリエーションを過剰に生成する。
  • BERTベースのランカーを用いて、誇張度とパラフレーズの質の両面から最良の候補を選択する。
  • 誇張表現生成をスタイル転送やパラフレーズ生成タスクとしてではなく、文の編集タスクとして定式化することで、誇張の制御性を高める。
  • 並列学習データを必要としない「過剰生成とランク付け」のパラダイムを活用し、出力品質を向上させる。

実験結果

リサーチクエスチョン

  • RQ1弱教師付き手法と人的フィードバックを組み合わせることで、非並列な大規模な誇張表現コーパスを効果的に構築できるか?
  • RQ2並列の意味的文と誇張表現のペアが存在しない状況でも、マスクされたシーケンス・トゥ・シーケンスモデルを微調整して誇張表現を生成できるか?
  • RQ3過剰生成とランク付けのパイプラインは、意味的で誇張的なパラフレーズを生成する際、エンドツーエンド法やベースライン手法を上回る性能を示せるか?
  • RQ4BERTベースのランカーは、生成出力における誇張度とパラフレーズの質の両方を効果的にバランスさせられるか?

主な発見

  • 提案されたHYPO-XLコーパスには、17,862件の高品質な誇張表現文が含まれており、現在までに公開された英語の同種のコーパスの中で最大規模である。
  • HYPO-XLで微調整されたBERTベースの誇張表現検出モデルは、テストセットで80%の正答率を達成し、誇張表現検出において優れた性能を示した。
  • 自動評価および人的評価の両方において、MOVERは複数のベースラインモデルを上回り、誇張表現のパラフレーズ生成において優れた性能を示した。
  • 人的評価により、MOVERが生成した文が、誇張度と意味の保持の間で良好なトレードオフを達成していることが確認された。
  • 過剰生成とランク付け戦略により、エンドツーエンド生成モデルと比較して、より解釈可能で柔軟な生成が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。