[论文解读] Context-Aware Abbreviation Expansion Using Large Language Models
本文提出了一种基于大语言模型(LLMs)的上下文感知缩写扩展(AE)系统,旨在为严重运动功能障碍者提供高击键节省率的文本输入方式。通过利用对话上下文,一个64B参数的LLM在将缩写(最多10个字符)扩展为完整短语时,准确率超过70%,击键节省率最高达77%,显著优于零上下文基线模型,并且在对噪声数据进行微调后,对打字错误也表现出良好的鲁棒性。
Motivated by the need for accelerating text entry in augmentative and alternative communication (AAC) for people with severe motor impairments, we propose a paradigm in which phrases are abbreviated aggressively as primarily word-initial letters. Our approach is to expand the abbreviations into full-phrase options by leveraging conversation context with the power of pretrained large language models (LLMs). Through zero-shot, few-shot, and fine-tuning experiments on four public conversation datasets, we show that for replies to the initial turn of a dialog, an LLM with 64B parameters is able to exactly expand over 70% of phrases with abbreviation length up to 10, leading to an effective keystroke saving rate of up to about 77% on these exact expansions. Including a small amount of context in the form of a single conversation turn more than doubles abbreviation expansion accuracies compared to having no context, an effect that is more pronounced for longer phrases. Additionally, the robustness of models against typo noise can be enhanced through fine-tuning on noisy data.
研究动机与目标
- 通过启用高击键节省率的缩写方案,降低严重运动功能障碍者使用眼动追踪进行文本输入时的运动与认知负担。
- 探究大语言模型(LLMs)是否能利用对话上下文准确扩展高度简化的短语。
- 评估上下文长度、 few-shot 提示和微调对缩写扩展准确率的影响。
- 评估基于LLM的AE对打字噪声的鲁棒性,并探索缓解策略。
- 开发一种可扩展的、开放词汇表的缩写扩展框架,适用于实时AAC应用。
提出的方法
- 作者通过将短语缩减为其首字母,创建了一种高击键节省率的缩写方案,最高可实现77%的击键节省。
- 他们通过将该方案应用于三个公开的对话数据集,构建了三个新的缩写扩展数据集,同时保留了对话上下文。
- 采用一个64B参数的LLM作为主干模型,输入包括缩写和来自对话的上下文窗口(0至1轮对话)。
- 模型生成候选扩展结果,再通过字符串匹配启发式方法筛选出仅匹配缩写模式的结果。
- 通过零样本提示、few-shot提示和在合成数据集上的微调来评估性能。
- 通过在缩写中引入随机字符替换来模拟打字错误,以测试鲁棒性,结果表明在噪声数据上进行微调可显著提升对错误的容忍度。
实验结果
研究问题
- RQ1当提供对话上下文时,大语言模型能否准确将高度简化的短语(例如1至10个首字母)扩展为完整短语?
- RQ2与无上下文相比,包含单个先前对话轮次是否能提升缩写扩展的准确性?
- RQ3在合成噪声缩写数据上对LLM进行微调,是否能提升其在真实AAC使用中对打字错误的鲁棒性?
- RQ4在不同对话上下文中,零样本、few-shot和微调提示策略在扩展准确率上的表现如何比较?
- RQ5当短语更长或更不常见时,模型性能会如何下降?上下文在多大程度上能缓解这一问题?
主要发现
- 对于对话初始轮次的回复,当提供单个先前对话轮次时,64B参数的LLM在缩写扩展任务上的准确率可达70%或以上,相比零上下文设置,准确率翻倍以上。
- 在正确扩展的短语上,模型的击键节省率(KSR)最高可达77%,证明了使用LLM实现高KSR文本输入的可行性。
- 与无上下文相比,包含单个对话轮次可使扩展准确率提升超过200%,且对较长短语的提升效果更为显著。
- 在合成错别字数据上对模型进行微调,可显著提升其对打字噪声的鲁棒性,降低在噪声缩写场景下的错误率。
- 微调后的LLM在所有评估的三个对话数据集上均达到SOTA性能,优于零样本和few-shot基线模型。
- 当有足够的上下文时,即使对于罕见或长篇短语,模型性能依然强劲,表明上下文能有效降低开放词汇表缩写扩展中的歧义。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。