APP下载

基于空间向量模型的先秦文献相似性研究

2014-03-21屈探春

文教资料 2014年30期
关键词:特征文本模型

屈探春

(南京师范大学 文学院,江苏 南京 210097)

基于空间向量模型的先秦文献相似性研究

屈探春

(南京师范大学 文学院,江苏 南京 210097)

本文基于空间向量模型,利用TF-IDF值,对《楚辞》、《公羊传》、《管子》、《谷梁传》、《国语》、《韩非子》、《老子》、《礼记》、《论语》、《吕氏春秋》、《孟子》、《墨子》、《商君书》、《诗经》、《孙子》、《武子》、《孝经》、《荀子》、《晏子春秋》、《仪礼》、《周礼》、《周易》、《庄子》、《尚书》和《左传》等二十五本先秦文献进行了相似度计算,通过分析文本的相似系数,考察文本间的相似程度和文献本身的特殊性。最终发现:部分文献用词较为封闭,用语风格独树一帜;部分文献用词则包容性,与其他文本的一致性较高。

先秦文献 相似性 向量空间模型 TF-IDF值

古汉语研究中,文本作者考证、著作年代探究等都是学者们的研究重点之一。他们常常从文本风格、用词特征等角度出发,通过比较同时期的同类作品或者寻找词语源流演变的轨迹等方法来探寻文献创作者,确定文献创作年代或判别文献真伪。这类研究中,古汉语研究者多依赖于文献典籍或考古文物等资料,以此为据作出相应的假设或者是论证已有假设。本文则主要利用自然语言处理中的相似度计算方法,通过计算文献间的相似系数来判断彼此间的相似程度。主要考察了《楚辞》、《公羊传》、《管子》、《谷梁传》、《国语》、《韩非子》、《老子》、《礼记》、《论语》、《吕氏春秋》、《孟子》、《墨子》、《商君书》、《诗经》、《孙子》、《武子》、《孝经》、《荀子》、《晏子春秋》、《仪礼》、《周礼》、《周易》、《庄子》、《尚书》、《左传》这二十五本文献,在统计各文本的词频、词长等基本数据的基础上,计算彼此间的相似系数,分析相似情况。……

登录APP查看全文

猜你喜欢

特征文本模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
线性代数的应用特征