[论文解读] VicunaNER: Zero/Few-shot Named Entity Recognition using Vicuna
VicunaNER 是一种基于开源大语言模型 Vicuna 构建的零样本和少样本命名实体识别框架,采用两阶段多轮对话机制:第一阶段为识别,用于提取实体;第二阶段为再识别,用于恢复第一阶段遗漏的实体。该框架在 10 个零样本数据集和 Few-NERD 上实现了最先进性能,在少样本设置下甚至优于基于 ChatGPT 的方法,同时避免了基于 API 的大语言模型固有的数据泄露和不可复现问题。
Large Language Models (LLMs, e.g., ChatGPT) have shown impressive zero- and few-shot capabilities in Named Entity Recognition (NER). However, these models can only be accessed via online APIs, which may cause data leak and non-reproducible problems. In this paper, we propose VicunaNER, a zero/few-shot NER framework based on the newly released open-source LLM -- Vicuna. VicunaNER is a two-phase framework, where each phase leverages multi-turn dialogues with Vicuna to recognize entities from texts. We name the second phase as Re-Recognition, which recognizes those entities not recognized in the first phase (a.k.a. Recognition). Moreover, we set entity correctness check dialogues in each phase to filter out wrong entities. We evaluate VicunaNER's zero-shot capacity on 10 datasets crossing 5 domains and few-shot capacity on Few-NERD. Experimental results demonstrate that VicunaNER achieves superior performance in both shot settings. Additionally, we conduct comprehensive investigations on Vicuna from multiple perspectives.
研究动机与目标
- 解决基于 API 的大语言模型(如 ChatGPT)在命名实体识别中存在数据泄露和不可复现的问题。
- 开发一种零样本和少样本命名实体识别框架,利用开源大语言模型,无需依赖专有 API。
- 通过引入两阶段对话机制,恢复遗漏实体,提升命名实体识别性能。
- 探究 Vicuna 在事实准确性以及实体边界和类型正确性方面的局限性。
- 为现有基于大语言模型的命名实体识别系统提供一种可复现、可本地部署的替代方案。
提出的方法
- 该框架采用基于 Vicuna 的两阶段多轮对话系统,每个阶段均执行实体识别与正确性验证。
- 在识别阶段,通过提供实体类型描述,向 Vicuna 发送提示以从文本中提取实体,随后通过独立的对话进行正确性检查。
- 在再识别阶段,通过利用第一阶段已识别的实体作为上下文,向 Vicuna 发送提示,识别第一阶段遗漏的实体,以实现恢复。
- 在两个阶段均应用正确性检查,以过滤掉错误的实体类型或非实体片段等虚假结果。
- 在去除重复项后,将两个阶段的实体列表合并,生成最终的命名实体识别输出。
- 该系统设计为可本地部署,避免对专有大语言模型 API 的依赖,从而确保数据隐私和可复现性。

实验结果
研究问题
- RQ1像 Vicuna 这类可本地部署的开源大语言模型,是否能在不依赖专有 API 的情况下,实现具有竞争力的零样本和少样本命名实体识别性能?
- RQ2采用再识别机制的两阶段对话框架,是否显著优于单阶段方法,从而提升实体恢复能力?
- RQ3Vicuna 的事实不一致性如何影响命名实体识别性能?多轮正确性检查能否有效缓解此类错误?
- RQ4VicunaNER 的性能是否优于现有基于大语言模型的命名实体识别框架(如 ChatIE),尤其是在零样本设置下?
- RQ5最优的再识别阶段数量是多少?增加更多阶段是否能带来显著的性能提升?
主要发现
- 在 xxx 个零样本数据集中的 xxx 个上,尽管 Vicuna 的能力弱于 ChatGPT,VicunaNER 仍优于基于 ChatGPT 的 ChatIE。
- 在 Few-NERD 的少样本设置下,VicunaNER 稳定超越所有基于大语言模型的框架以及原型网络基线模型。
- 再识别阶段显著提升了召回率,成功恢复了大量在初始识别阶段被遗漏的实体。
- 多轮正确性检查能有效过滤实体类型错误和虚假结果,提升精确率,同时不损失召回率。
- 增加超过一个再识别阶段仅带来微小的性能增益,但显著增加了推理时间。
- 该框架实现了完全可复现的本地命名实体识别,无数据泄露风险,而基于 API 的大语言模型则存在此类风险。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。