Skip to main content
QUICK REVIEW

[论文解读] Flexible Computing Services for Comparisons and Analyses of Classical Chinese Poetry

Chao-Lin Liu|arXiv (Cornell University)|Sep 18, 2017
Natural Language Processing Techniques参考文献 3被引用 3
一句话总结

本文提出了一套灵活的计算框架,整合了九部从公元前1046年至1644年的历史中文诗歌语料库,以支持对词汇使用、搭配词和诗歌模式的比较与历史分析。通过结合定制化工具与精心整理的语料库,作者展示了比较诗人词汇偏好的新方法,并追踪了中文词汇的演变,为丰富数字中文词典和推进文学研究提供了可扩展的资源。

ABSTRACT

We collect nine corpora of representative Chinese poetry for the time span of 1046 BCE and 1644 CE for studying the history of Chinese words, collocations, and patterns. By flexibly integrating our own tools, we are able to provide new perspectives for approaching our goals. We illustrate the ideas with two examples. The first example show a new way to compare word preferences of poets, and the second example demonstrates how we can utilize our corpora in historical studies of the Chinese words. We show the viability of the tools for academic research, and we wish to make it helpful for enriching existing Chinese dictionary as well.

研究动机与目标

  • 开发一个灵活的计算基础设施,用于古典中文诗歌的比较与历史分析。
  • 收集并整合涵盖公元前1046年至1644年期间的九部代表性中文诗歌语料库。
  • 通过定量文本分析,实现使用计算方法比较诗人词汇偏好的新方法。
  • 通过系统的语料库分析,支持中文词汇演变的历史研究。
  • 通过数据驱动的洞察,促进数字中文词典的完善。

提出的方法

  • 作者整理了九部涵盖从公元前1046年至1644年整个时期的古典中文诗歌语料库。
  • 开发了特定领域的文本处理工具,以提取和分析词汇频率、搭配词和风格模式等语言特征。
  • 灵活的集成架构支持工具与语料库的动态组合,以应对多样化的分析任务。
  • 该框架通过支持诗人之间词汇偏好的并列评估,实现比较分析。
  • 系统支持词汇使用的纵向分析,以追踪其在时间上的语义与句法演变。
  • 通过两个案例研究验证了该方法:诗人比较与历史词汇研究。

实验结果

研究问题

  • RQ1如何通过计算方法系统性地比较古典中文诗人的词汇偏好?
  • RQ2在对多个世纪的中文诗歌进行分析时,词汇使用和搭配词的模式是什么?
  • RQ3计算工具如何支持中文词汇演变的历史研究?
  • RQ4数字语料库在促进学术中文词典发展方面有哪些作用?
  • RQ5构建一个灵活且可扩展的古典中文诗歌分析系统,其技术和方法论要求是什么?

主要发现

  • 该框架成功实现了对诗人词汇选择的新比较洞察,揭示了不同作者之间显著的风格偏好差异。
  • 九部历史语料库的整合提供了纵向语言分析所必需的全面时间覆盖。
  • 该系统通过支持可复现的、数据驱动的诗歌文本分析,证明了其在学术研究中的可行性。
  • 该方法为通过历史用法模式和搭配数据丰富数字中文词典提供了可扩展的基础。
  • 两个案例研究展示了其方法论价值:一个聚焦于特定诗人的词汇偏好,另一个关注特定词汇项的历史演变。
  • 结果表明,计算工具可显著增强古典中文诗歌的传统训诂学与文学研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。