[论文解读] Joint Learning of Domain Classification and Out-of-Domain Detection with Dynamic Class Weighting for Satisficing False Acceptance Rates
本文提出了一种用于语音对话系统中领域分类与域外(OOD)检测的联合学习框架,通过动态类别加权以满足目标误接受率(FAR),同时最大化分类准确率。该方法联合训练基于BiLSTM的模型,为两项任务共享表示,并通过每轮调整损失权重以优先控制FAR,相较于在两个Alexa数据集上单独训练或单指标优化,实现了显著的准确率提升。
In domain classification for spoken dialog systems, correct detection of out-of-domain (OOD) utterances is crucial because it reduces confusion and unnecessary interaction costs between users and the systems. Previous work usually utilizes OOD detectors that are trained separately from in-domain (IND) classifiers, and confidence thresholding for OOD detection given target evaluation scores. In this paper, we introduce a neural joint learning model for domain classification and OOD detection, where dynamic class weighting is used during the model training to satisfice a given OOD false acceptance rate (FAR) while maximizing the domain classification accuracy. Evaluating on two domain classification tasks for the utterances from a large spoken dialogue system, we show that our approach significantly improves the domain classification performance with satisficing given target FARs.
研究动机与目标
- 解决在语音对话系统中保持低域外误接受率(FAR)的同时最大化域内分类准确率的挑战。
- 克服单独训练领域分类器与OOD检测器的局限性,后者通常无法将FAR作为满足性约束加以优先考虑。
- 开发一种联合学习模型,利用领域分类与OOD检测之间的共享表示以提升性能。
- 在训练过程中动态调整类别权重,以平衡FAR控制与准确率优化,避免使用固定或预计算的加权方案。
- 在具有多样化领域与域外话语分布的真实世界Alexa数据集上评估该方法。
提出的方法
- 使用双向长短期记忆网络(BiLSTM)联合训练神经模型,从词级和字符级嵌入中提取话语的上下文表示。
- 模型联合优化两个分支:用于域内(IND)分类的多分类分类器和用于OOD检测的二分类分类器,二者共享相同的BiLSTM表示。
- 在训练过程中应用动态类别加权,根据开发集上的当前FAR调整OOD样本的损失权重,确保FAR始终低于目标阈值。
- 将优化目标表述为约束问题:在FAR ≤ T的条件下最大化准确率,其中T为目标误接受率。
- 使用可微分的代理损失函数近似不可微的约束,从而实现端到端的梯度下降训练。
- 通过系数α控制OOD损失的相对重要性,该系数在每轮训练中进行调整,以维持目标FAR。
实验结果
研究问题
- RQ1与单独训练相比,领域分类与OOD检测的联合学习是否能提升整体分类性能?
- RQ2动态类别加权是否能够在最大化域内准确率的同时,更好地满足目标误接受率(FAR)?
- RQ3与仅优化单一指标或使用固定类别权重的模型相比,采用动态加权的联合模型性能如何?
- RQ4领域分类与OOD检测之间共享表示学习在多大程度上增强了模型的鲁棒性与泛化能力?
- RQ5所提出的方法是否能在具有高领域多样性的多样化真实语音对话数据集中保持低FAR?
主要发现
- 在21个领域的Alexa数据集中,采用动态类别加权的联合模型在目标FAR为6%时达到90.67%的准确率,显著优于单独训练模型(85.69%)及其他联合模型。
- 在目标FAR为5%时,动态加权模型达到90.26%的准确率,较无动态加权的最佳基线模型(87.83%)提升了2.5个百分点。
- 在1,500个技能的Alexa数据集中,动态加权模型在2%目标FAR下达到79.18%的准确率,优于单独训练模型(77.50%)及其他联合模型。
- 采用动态类别加权的模型在所有评估阈值(6%、5.5%、5%和2%、1.5%、1%)下均稳定维持了目标FAR,同时最大化准确率。
- 在两个数据集中,BiLSTM用于话语编码的性能优于词向量求和与基于CNN的方法,尤其在动态加权设置下表现更优。
- 与无OOD监督的模型相比,加入OOD检测的联合训练(α > 0)显著提升了准确率,证明了共享表示学习的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。