[論文レビュー] Generating similes effortlessly like a Pro: A Style Transfer Approach for Simile Generation
本稿では、文脈的常識知識を組み込んだ大規模な自動構築された並列コーパスを用いてBARTを微調整することで、創造的比喩を生成するためのスタイル転送手法SCOPEを提案する。COMETから得られる常識知識を活用し、文学的専門家の比喩よりも37%の割合で高く評価され、ベースラインよりも68-82%の割合で優れる比喩を生成する。これは比喩的言語生成分野における優れた性能を示している。
Literary tropes, from poetry to stories, are at the crux of human imagination and communication. Figurative language such as a simile go beyond plain expressions to give readers new insights and inspirations. In this paper, we tackle the problem of simile generation. Generating a simile requires proper understanding for effective mapping of properties between two concepts. To this end, we first propose a method to automatically construct a parallel corpus by transforming a large number of similes collected from Reddit to their literal counterpart using structured common sense knowledge. We then propose to fine-tune a pretrained sequence to sequence model, BART~\cite{lewis2019bart}, on the literal-simile pairs to gain generalizability, so that we can generate novel similes given a literal sentence. Experiments show that our approach generates $88\%$ novel similes that do not share properties with the training data. Human evaluation on an independent set of literal statements shows that our model generates similes better than two literary experts extit{37\%}\footnote{We average 32.6\% and 41.3\% for 2 humans.} of the times, and three baseline systems including a recent metaphor generation model extit{71\%}\footnote{We average 82\% ,63\% and 68\% for three baselines.} of the times when compared pairwise.\footnote{The simile in the title is generated by our best model. Input: Generating similes effortlessly, output: Generating similes extit{like a Pro}.} We also show how replacing literal sentences with similes from our best model in machine generated stories improves evocativeness and leads to better acceptance by human judges.
研究の動機と目的
- 比喩生成のための訓練データの不足に応えるために、自動的に大規模な並列コーパス(直訳文とその比喩的対応文)を構築すること。
- 比喩生成をスタイル転送タスクとして定式化し、共通の性質を用いて直訳的記述を比喩的比較に変換すること。
- 訓練プロセスに構造化された常識知識を統合することで、生成された比喩の質と創造性を向上させること。
- 生成された比喩が、物語の説得力や人間の好みといった、下流の創造的テキスト生成タスクに与える影響を評価すること。
提案手法
- Redditからキーワード'like a'を用いて比喩を自動収集し、初期の並列ペアセットを形成する。
- COMET(文脈的常識知識モデル)を用いて、比喩から比較の接頭語'like'を除去し、乗り物(vehicle)をその関連する性質に置き換えることで、各比喩をその直訳的対応に変換する。
- 得られた[literal, simile]ペアを用いて、BARTのsequence-to-sequenceモデルを微調整し、直訳的表現から比喩的表現へのスタイル転送を学習する。
- COMETから得られる構造化された常識知識を活用し、生成された比喩が意味的に整合的で、意味的性質のマッピングが適切であることを保証する。
- 訓練済みモデルを用いて、機械生成された物語の後処理を行い、直訳的記述を生成された比喩に置き換えることで、説得力を向上させる。
- Amazon Mechanical Turkを用いた人間評価を通じて、モデル出力と文学的専門家・ベースラインシステムの出力を比較する。
実験結果
リサーチクエスチョン
- RQ1遠隔監視と常識知識を用いて、直訳文とその比喩的対応文の大型並列コーパスを自動的に構築できるか?
- RQ2このようなコーパスを用いて、事前学習済みsequence-to-sequenceモデル(例:BART)を微調整することで、訓練データから単に記憶されたものではない、高品質で新規の比喩を生成できるか?
- RQ3人間の文学的専門家が作成した比喩と比較して、モデルが生成した比喩の質と創造性はどの程度か?
- RQ4生成された比喩が、機械生成された物語の説得力と人間の受け入れ度にどの程度向上効果をもたらすか?
主な発見
- 提案手法は、訓練データと全く同じ性質を共有しない比喩を88%生成しており、強力な一般化能力と新規性を示している。
- 人間評価の結果、モデルが生成した比喩は、2名の文学的専門家の比喩よりも平均37%の割合で好まれた。
- 最近の隠喩生成モデルも含む3つのベースラインシステムと比較した結果、モデルは68%から82%の割合で優れていた。
- 機械生成物語に対してモデルが生成した比喩を後処理として適用することで、説得力が著しく向上し、人間の評価者から好まれた。
- COMETによる常識知識の統合が、意味的に意味のある、文脈的に適切な比喩を生成するために不可欠であった。
- 本手法は、常識を補強したデータを用いたスタイル転送が、創造的な比喩的言語を効果的に生成できることを示しており、創造的ライティング分野におけるNLGの新たな道を切り開いている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。