[论文解读] Tracking Words in Chinese Poetry of Tang and Song Dynasties with the China Biographical Database
本文提出了一套计算框架,利用中国人物传记数据库(CBDB)追踪唐宋时期汉语诗歌中的词汇与习语模式。通过采用高效的文本比对算法和大规模语料分析,识别出显著的词汇使用趋势——如色彩词频率的差异——揭示了两个朝代之间语言与社会历史的变迁,其主要贡献体现在词典学、语义学和数字人文研究领域。
Large-scale comparisons between the poetry of Tang and Song dynasties shed light on how words, collocations, and expressions were used and shared among the poets. That some words were used only in the Tang poetry and some only in the Song poetry could lead to interesting research in linguistics. That the most frequent colors are different in the Tang and Song poetry provides a trace of the changing social circumstances in the dynasties. Results of the current work link to research topics of lexicography, semantics, and social transitions. We discuss our findings and present our algorithms for efficient comparisons among the poems, which are crucial for completing billion times of comparisons within acceptable time.
研究动机与目标
- 在大规模范围内探究唐宋时期汉语诗歌的词汇与习语差异。
- 识别词汇使用模式如何反映中国帝制时期的社会历史变迁。
- 开发高效的计算方法,以处理大规模诗歌语料中数十亿次的文本比对。
- 通过将语言特征与历史背景关联,推动词典学与语义学研究。
- 通过系统化、数据驱动的古典汉语文学分析,推动数字人文研究。
提出的方法
- 以中国人物传记数据库(CBDB)作为基础资源,将诗人及其传记数据与他们的诗歌作品关联起来。
- 应用优化的文本比对算法,高效处理并分析唐宋诗歌语料中数十亿次的词汇与习语比对。
- 采用基于频率的词汇分析方法,识别出每个朝代独有的高频词汇与表达。
- 对色彩词及其他语义类别进行对比分析,以检测风格与文化层面的变迁。
- 整合计算语言学技术与历史数据,实现对古典汉语诗歌的大规模、可重复分析。
- 通过算法优化,在保持识别稀有或独特词汇模式准确性的前提下,显著缩短处理时间。
实验结果
研究问题
- RQ1哪些词汇与习语模式能够区分唐诗与宋诗?
- RQ2特定语义类别(如色彩词)在两个朝代中的使用频率有何差异?
- RQ3词汇使用模式在多大程度上反映了中国帝制时期更广泛的社会与文化转型?
- RQ4哪些计算方法能够实现对古典汉语诗歌语料的大规模、高效比较?
- RQ5如何利用中国人物传记数据库将语言特征与历史传记数据关联起来?
主要发现
- 研究识别出唐诗与宋诗中存在显著不同的词汇偏好,部分词汇与习语仅出现在某一朝代。
- 两朝在色彩词的使用上存在显著差异,暗示了审美或文化价值观随时间的演变。
- 唐诗中最常见的色彩词与宋诗不同,为社会与艺术品味的变迁提供了语言学证据。
- 所提出的算法能够高效比较大规模诗歌语料,在可接受的计算时间内完成数十亿次比对。
- 研究结果为数字词典学与古典汉语文学的语义分析开辟了新途径。
- 将传记数据与诗歌文本分析相结合,揭示了诗人身份与语言风格之间的相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。