Skip to main content
QUICK REVIEW

[论文解读] Adposition and Case Supersenses v2.6: Guidelines for English

Nathan Schneider, Jena D. Hwang|arXiv (Cornell University)|Apr 7, 2017
Natural Language Processing Techniques参考文献 23被引用 13
一句话总结

本文介紹了 SNACS(介詞與格標記語義網絡超 senses)框架的 v2.6 版本,該框架為英語中介詞與格標記的語義角色提供了一套 52 個標籤的分類體系。透過跨語言分析與語料標註,對早期版本進行了完善,提出了一套結構化、分層的系統,用以捕捉時間、處所與因果等語義功能,並在語義角色標註與消歧等自然語言處理任務中具有應用價值。

ABSTRACT

This document offers a detailed linguistic description of SNACS (Semantic Network of Adposition and Case Supersenses; Schneider et al., 2018), an inventory of 52 semantic labels ("supersenses") that characterize the use of adpositions and case markers at a somewhat coarse level of granularity, as demonstrated in the STREUSLE corpus (https://github.com/nert-nlp/streusle/ ; version 4.5 tracks guidelines version 2.6). Though the SNACS inventory aspires to be universal, this document is specific to English; documentation for other languages will be published separately. Version 2 is a revision of the supersense inventory proposed for English by Schneider et al. (2015, 2016) (henceforth "v1"), which in turn was based on previous schemes. The present inventory was developed after extensive review of the v1 corpus annotations for English, plus previously unanalyzed genitive case possessives (Blodgett and Schneider, 2018), as well as consideration of adposition and case phenomena in Hebrew, Hindi, Korean, and German. Hwang et al. (2017) present the theoretical underpinnings of the v2 scheme. Schneider et al. (2018) summarize the scheme, its application to English corpus data, and an automatic disambiguation task. Liu et al. (2021) offer an English Lexical Semantic Recognition tagger that includes SNACS labels in its output. This documentation can also be browsed alongside corpus data on the Xposition website (Gessler et al., 2022): http://www.xposition.org/

研究动机与目标

  • 開發一套通用的、基於語言學的英語中介詞與格標記語義角色分類體系。
  • 根據大量語料標註與與希伯來語、印地語、韓語及德語的跨語言比較,對超 senses 層次結構進行精煉與簡化。
  • 透過定義明確的語義差異(例如時間 vs. 處所、目的 vs. 方式)來解決介詞與格標記使用中的歧義。
  • 支援下游自然語言處理任務,如語義角色標註、詞義消歧與詞彙語義識別。
  • 提供一個穩定且可擴展的框架,以支援多語言語義標註與跨語言比較。

提出的方法

  • 設計一個包含 52 個語義標籤的分層超 senses 分類體系,分為四個主要類別:CIRCUMSTANCE、PARTICIPANT、CONFIGURATION,以及語義功能與角色組合的限制。
  • 根據語料證據與跨語言分析,移除冗餘或有問題的類別(例如具體與抽象處所、價值與狀態的區分),以修訂超 senses 分類法。
  • 整合來自標註語料(如 STREUSLE v4.5)與特殊句式(如所有格、被動語態、比較結構)的洞見,以精煉標籤定義。
  • 將該框架應用於實際句法結構,包括不定式子句、所有格與比較結構,並提供詳細的標註指引。
  • 採用表徵(construal)基礎的方法,模擬介詞與格標記如何編碼語義關係,區分功能(例如 TIME、SOURCE)與角色(例如 THEME、CAUSER)。
  • 透過迭代修訂(v2.0–v2.6)記錄並驗證系統,整合語料標註與多語言比較的反饋。

实验结果

研究问题

  • RQ1如何系統性地將英語中介詞與格標記分類至一個一致的語義分類體系?
  • RQ2在多樣的句法結構中,哪些語義差異是解決介詞與格標記使用歧義所必要且充分的?
  • RQ3希伯來語、印地語、韓語與德語中的跨語言模式如何影響為英語設計通用超 senses 框架?
  • RQ4語義功能(例如 TIME、SOURCE)與角色(例如 THEME、RECIPIENT)在介詞結構中的組合受到哪些限制?
  • RQ5簡化的、非分層的超 senses 系統在語義角色標註與詞義消歧等自然語言處理任務中,能在多大程度上提升性能?

主要发现

  • v2.6 超 senses 分類體系透過移除如具體與抽象處所、價值與狀態區分等冗餘類別,降低了複雜度,提升了一致性和可用性。
  • 該框架成功解決了長期存在的介詞使用歧義,例如 DURATION 與 TIME 的區分,並明確指出 'as...as' 比較結構中 'as' 的功能為 EXTENT。
  • 所有格結構現已透過 POSSESSOR(所有者)與 POSSESSION(所有物)一致標註,提升了標註精確度。
  • RECIPIENT 的定義已修訂,不再要求受事者具有生命性,從而擴展其適用範圍至如 'the gift was given to the box' 之類的非生命受事結構。
  • 被動語態的處理現明確將施事者分配給 CAUSER,受事者分配給 THEME,與語義角色理論一致。
  • 該框架支援自動消歧任務,並已整合至如 English Lexical Semantic Recognition tagger 等系統,展現其在自然語言處理流程中的實用價值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。