Skip to main content
QUICK REVIEW

[论文解读] #HashtagWars: Learning a Sense of Humor

Peter Potash, Alexey Romanov|arXiv (Cornell University)|Dec 9, 2016
Humor Studies and Applications参考文献 19被引用 6
一句话总结

本文介紹了#HashtagWars(HW)數據集,這是一個大規模的幽默推文集合,來自 Comedy Central 的 @midnight 節目對特定標籤的回應,支援比較性幽默排名而非二元幽默檢測。透過半自動化的資料收集流程,作者證明了字元級神經模型表現優於詞元級模型——達成 63.7% 的準確率——因其能有效捕捉到對幽默至關重要的雙關語與未登錄詞。

ABSTRACT

In this work, we present a new dataset for computational humor, specifically comparative humor ranking, which attempts to eschew the ubiquitous binary approach to humor detection. The dataset consists of tweets that are humorous responses to a given hashtag. We describe the motivation for this new dataset, as well as the collection process, which includes a description of our semi-automated system for data collection. We also present initial experiments for this dataset using both unsupervised and supervised approaches. Our best supervised system achieved 63.7% accuracy, suggesting that this task is much more difficult than comparable humor detection tasks. Initial experiments indicate that a character-level model is more suitable for this task than a token-level model, likely due to a large amount of puns that can be captured by a character-level model.

研究动机与目标

  • 為解決二元幽默檢測的限制,提出基於主觀、節目層級幽默判斷的比較性幽默排名。
  • 建立一個大規模、真實世界的幽默推文數據集,收錄來自現場電視喜劇節目中觀眾對標籤的回應,並具備既定的幽默評估標準。
  • 探討計算模型是否能學會相對於特定幽默感(非普適)進行幽默排序,而非孤立地檢測幽默。
  • 評估不同神經架構(特別是字元級與詞元級模型)在捕捉短文本中雙關語幽默方面的有效性。
  • 探討外部知識與模型集成在提升幽默理解能力方面的潛力,超越僅依賴語義嵌入的方法。

提出的方法

  • 透過半自動化系統,從 @midnight 電視節目中抓取觀眾針對標籤提交的推文,並使用節目提供的標籤作為相對幽默排名的依據。
  • 任務被定義為成對比較:給定同一標籤的兩則推文,預測節目認為哪則更可笑。
  • 使用前饋神經網絡(FFNN)訓練監督模型,輸入表示來自字元級 RNN 或平均詞元嵌入與 HTE(異質文本嵌入)。
  • 字元級模型以字元為單位處理推文,能更有效地處理未登錄詞與常見於數據集中雙關語。
  • 性能以保留測試標籤上的微準確率進行評估,並透過消融實驗比較加入或不加入 dropout 及不同嵌入類型的模型。
  • 對測試標籤嵌入與訓練標籤平均值之間的餘弦相似度進行分析,以評估跨標籤的可遷移性。

实验结果

研究问题

  • RQ1計算模型能否學會相對於特定、非普適的幽默感(如電視節目對幽默推文的選擇)進行幽默排序?
  • RQ2在捕捉短社交媒體文本中的雙關語幽默方面,字元級神經模型是否優於詞元級模型?
  • RQ3幽默排序模型的性能在多大程度上能泛化至不同標籤?測試與訓練標籤之間的相似性如何影響準確率?
  • RQ4僅對詞元嵌入進行簡單平均是否能提供具競爭力的基線表現,還是需要更複雜的序列建模?
  • RQ5集成方法或與外部知識來源(例如透過神經圖靈機)整合是否具有提升此任務表現的潛力?

主要发现

  • 所提出的 #HashtagWars 數據集比現有的幽默數據集(如 NYCC 數據集)大幾個數量級,使幽默排序系統的評估更具魯棒性。
  • 表現最佳的監督模型在成對幽默排序任務中達成 63.7% 的準確率,顯示此任務明顯比二元幽默檢測更具挑戰性。
  • 字元級模型表現優於所有詞元級模型,顯示捕捉詞形與音韻模式(例如雙關語)對此任務至關重要。
  • 基於 RNN 的字元級模型所學到的表示比簡單平均詞元嵌入更為有效,即使使用相同的下游分類器,其表現也更優異。
  • 標籤相似度(基於平均嵌入)與測試準確率之間的相關係數僅為 0.223,顯示標籤嵌入相似度並非模型泛化能力的強預測指標。
  • 所有系統的結果在多次運行中極為穩定,微準確率的標準差均低於 0.01(隨機基線除外),確認了評估架構的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。