[论文解读] Interactive Spoken Content Retrieval by Deep Reinforcement Learning
本文提出了一种基于深度Q网络(DQN)的端到端深度强化学习方法,通过直接将原始检索得分映射到最优系统动作,绕过人工设计的状态估计,从而提升交互式语音内容检索的性能。该方法在仅使用原始相关性得分而无需人工工程指标的情况下,显著优于以往依赖手动设计特征的最先进方法,甚至在某些情况下表现更优。
User-machine interaction is important for spoken content retrieval. For text content retrieval, the user can easily scan through and select on a list of retrieved item. This is impossible for spoken content retrieval, because the retrieved items are difficult to show on screen. Besides, due to the high degree of uncertainty for speech recognition, the retrieval results can be very noisy. One way to counter such difficulties is through user-machine interaction. The machine can take different actions to interact with the user to obtain better retrieval results before showing to the user. The suitable actions depend on the retrieval status, for example requesting for extra information from the user, returning a list of topics for user to select, etc. In our previous work, some hand-crafted states estimated from the present retrieval results are used to determine the proper actions. In this paper, we propose to use Deep-Q-Learning techniques instead to determine the machine actions for interactive spoken content retrieval. Deep-Q-Learning bypasses the need for estimation of the hand-crafted states, and directly determine the best action base on the present retrieval status even without any human knowledge. It is shown to achieve significantly better performance compared with the previous hand-crafted states.
研究动机与目标
- 为解决语音识别中噪声和不确定性带来的挑战,传统基于文本的检索接口在这些场景下效果不佳。
- 克服以往交互式检索系统依赖从检索特征中人工设计的状态估计所导致的局限性,这些方法可能次优且缺乏联合优化。
- 探究深度强化学习是否能够直接从原始检索得分端到端学习最优交互策略,从而消除对人工设计状态表示的依赖。
- 评估基于DQN的动作选择在交互式语音内容检索中相对于以往方法的性能表现,这些方法使用原始特征和人工工程指标。
提出的方法
- 系统使用深度Q网络(DQN)将来自基于语言模型的检索模块生成的原始检索得分直接映射到系统动作,绕过显式的状态估计。
- DQN将给定查询的前-k 个检索文档的相关性得分作为输入,实现从原始特征端到端学习动作策略。
- 动作空间包括请求额外用户输入、返回主题列表或细化查询等选项,根据当前检索状态进行选择。
- DQN通过强化学习目标进行训练,以最大化累积奖励,该奖励定义为交互序列的回报,稀疏奖励基于检索有效性(如MAP和每轮的返回值)。
- 框架通过使用单最佳转录本和基于词图的ASR输出进行评估,以检验在不同识别质量下的鲁棒性。
- 该方法与基于人工设计状态(如平均精度)的基线方法和随机动作基线进行比较,并通过暴力搜索动作序列计算了最优上界。
实验结果
研究问题
- RQ1深度强化学习智能体是否能够仅从原始检索得分直接学习有效的交互策略,而无需依赖人工设计的状态表示?
- RQ2与使用人工设计特征和级联状态估计的先前方法相比,基于端到端DQN的方法性能如何?
- RQ3在缺乏人工工程特征的情况下,仅使用原始相关性得分在多大程度上能够支持交互式语音检索中的有效动作选择?
- RQ4在DQN框架中,模型深度和输入特征构成(原始得分 vs. 原始得分 + 人工特征)如何影响学习稳定性和最终性能?
主要发现
- 仅使用原始相关性得分(不包含任何人工设计特征)的DQN方法,优于依赖人工设计状态的先前最先进方法,在单最佳转录本上达到MAP 0.5619,在词图上达到0.5847。
- 当将原始相关性得分与人工工程特征结合时,DQN在单最佳转录本上达到最佳性能,MAP为0.5691,在词图上达到0.5907,甚至在词图上的返回值(110.90 vs. 105.03)超过了最优上界。
- 仅使用原始得分的DQN收敛到稳定策略,表明复杂的端到端状态-动作映射可通过深层网络隐式学习,而无需显式特征工程。
- 更深的DQN架构(4个隐藏层)优于浅层结构(2层)和线性模型,尤其是在仅使用原始得分时,尽管收敛速度更慢。
- 当仅使用原始得分时,线性模型未能收敛,表明从原始得分到最优动作的映射是非线性的,需要隐藏表示。
- 仅使用一个相关性得分作为输入时,DQN能够学习到基本策略,但随着输入得分数量的增加(如10、50、100),性能显著提升,表明该方法在输入规模上具有可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。