[论文解读] I like fish, especially dolphins: Addressing Contradictions in Dialogue Modeling
本文提出了DECODE任務與一個新的對話矛盾檢測數據集,提出了一種使用微調後的RoBERTa模型的結構化語句配對方法,該方法在對抗矛盾方面優於傳統的非結構化方法。該方法與人類判斷具有強烈相關性,並透過重排序有效降低了生成式聊天機器人的矛盾輸出,展現出在分布外對話中的改進魯棒性與遷移能力。
To quantify how well natural language understanding models can capture consistency in a general conversation, we introduce the DialoguE COntradiction DEtection task (DECODE) and a new conversational dataset containing both human-human and human-bot contradictory dialogues. We then compare a structured utterance-based approach of using pre-trained Transformer models for contradiction detection with the typical unstructured approach. Results reveal that: (i) our newly collected dataset is notably more effective at providing supervision for the dialogue contradiction detection task than existing NLI data including those aimed to cover the dialogue domain; (ii) the structured utterance-based approach is more robust and transferable on both analysis and out-of-distribution dialogues than its unstructured counterpart. We also show that our best contradiction detection model correlates well with human judgments and further provide evidence for its usage in both automatically evaluating and improving the consistency of state-of-the-art generative chatbots.
研究动机与目标
- 為了解決開放領域對話系統中缺乏有效基準以衡量一致性的問題。
- 探討預訓練的自然語言理解模型在對話情境中檢測矛盾的能力有多好。
- 比較結構化與非結構化方法在對話矛盾檢測中的表現。
- 評估矛盾檢測是否可用於自動評估與改進生成式聊天機器人的一致性。
- 提供一個與人類判斷高度相關的可靠自動化指標,用於對話一致性評估。
提出的方法
- 作者提出對話理解矛盾檢測(DialoguE COntradiction DEtection, DECODE)任務,以量化對話中的一致性。
- 他們收集了一個包含人為設計矛盾的對話新數據集,以及一個獨立的分布外(OOD)對話集,其中包含標註自矛盾的人機對話。
- 採用基於語句的結構化方法,在將語句輸入預訓練的Transformer NLI模型(如RoBERTa)之前,將每個語句與其先前的上下文語句配對。
- 非結構化方法則將所有對話語句連接起來,直接輸入相同的NLI模型。
- 最佳模型在DECODE數據集上進行微調,並用作自動指標,在BlenderBot的解碼過程中對候選語句進行重排序。
- 該方法應用束搜索(beam search)、top-k採樣以及採樣與重排序策略,基於矛盾檢測分數提升生成的一致性。
实验结果
研究问题
- RQ1與現有的NLI數據集相比,新收集的DECODE數據集在訓練對話矛盾檢測模型時,其監督品質如何?
- RQ2基於語句的結構化配對方法是否優於標準的非結構化連接方法,在對話矛盾檢測中的表現?
- RQ3最佳矛盾檢測模型與人類對一致性判斷的相關性有多高?
- RQ4矛盾檢測器是否可用於自動改進最先进生成式聊天機器人的一致性?
- RQ5該結構化方法在分布外(OOD)對話設定下的遷移能力如何?
主要发现
- DECODE數據集在對話矛盾檢測的監督品質方面,顯著優於現有的NLI數據集。
- 基於語句的結構化方法在魯棒性與對分布外對話的遷移能力方面,優於非結構化方法。
- 在DECODE數據集上微調的RoBERTa模型(最佳矛盾檢測器)與人類對一致性判斷的相關性極高。
- 在解碼過程中使用檢測器進行重排序,可有效降低矛盾率:從束搜索的22.7%降至top-k採樣的1.1%。
- 人類評估結果確認,基於DECODE的重排序在多種解碼策略下均能降低矛盾率,驗證了其有效性。
- 該方法在缺乏領域內微調數據的情況下,展現出將NLU一致性模塊整合至NLG系統的潛力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。