基于空间向量模型的先秦文献相似性研究
2014-03-21屈探春
屈探春
(南京师范大学 文学院,江苏 南京 210097)
基于空间向量模型的先秦文献相似性研究
屈探春
(南京师范大学 文学院,江苏 南京 210097)
本文基于空间向量模型,利用TF-IDF值,对《楚辞》、《公羊传》、《管子》、《谷梁传》、《国语》、《韩非子》、《老子》、《礼记》、《论语》、《吕氏春秋》、《孟子》、《墨子》、《商君书》、《诗经》、《孙子》、《武子》、《孝经》、《荀子》、《晏子春秋》、《仪礼》、《周礼》、《周易》、《庄子》、《尚书》和《左传》等二十五本先秦文献进行了相似度计算,通过分析文本的相似系数,考察文本间的相似程度和文献本身的特殊性。最终发现:部分文献用词较为封闭,用语风格独树一帜;部分文献用词则包容性,与其他文本的一致性较高。
先秦文献 相似性 向量空间模型 TF-IDF值
古汉语研究中,文本作者考证、著作年代探究等都是学者们的研究重点之一。他们常常从文本风格、用词特征等角度出发,通过比较同时期的同类作品或者寻找词语源流演变的轨迹等方法来探寻文献创作者,确定文献创作年代或判别文献真伪。这类研究中,古汉语研究者多依赖于文献典籍或考古文物等资料,以此为据作出相应的假设或者是论证已有假设。本文则主要利用自然语言处理中的相似度计算方法,通过计算文献间的相似系数来判断彼此间的相似程度。主要考察了《楚辞》、《公羊传》、《管子》、《谷梁传》、《国语》、《韩非子》、《老子》、《礼记》、《论语》、《吕氏春秋》、《孟子》、《墨子》、《商君书》、《诗经》、《孙子》、《武子》、《孝经》、《荀子》、《晏子春秋》、《仪礼》、《周礼》、《周易》、《庄子》、《尚书》、《左传》这二十五本文献,在统计各文本的词频、词长等基本数据的基础上,计算彼此间的相似系数,分析相似情况。……
