APP下载

基于向量空间模型的文本风格相似度分析
——以女性文学为例

2014-03-21邢翠鹃

文教资料 2014年29期
关键词:特征文本

邢翠鹃

(南京师范大学 文学院,江苏 南京 210097)

基于向量空间模型的文本风格相似度分析
——以女性文学为例

邢翠鹃

(南京师范大学 文学院,江苏 南京 210097)

本文主要用向量空间模型(Vector Space Model,VSM)来分析女性文学代表作家的作品,通过TF-IDF计算文本特征项的权重,最后根据计算结果来分析这些女性文学作家作品的文本风格相似度。并以此证明同时代不同作家或不同时代同类作家(女性文学作家)的文本是同中有异,异中有同,此外还分析了部分特征词的分布情况。

向量空间模型 TF-IDF 文本相似度 女性文学

引言:

文本中的相似度计算是自然语言处理领域中的关键问题之一,在信息检索、信息抽取、专利分析等领域都有着重要的应用价值。面对现代网络信息时代的海量信息,我们可以通过文本相似度算法来为信息分类,以提高信息检索的效率。早在20世纪30年代,西方文体学界即开始引入定量分析,尤其是统计学的方法[1],而将计算方法应用于汉语语言风格学研究最早始于20世纪70、80年代,人们用词频统计等方法来考证《红楼梦》的作者归属问题。这种方法也得到了我国语言风格学界一些学者的肯定,如黎运汉先生就专文论述了语言风格研究中常用的三种方法:分析综合法、比较法和统计法。他指出,“统计法适用于各种语言风格的研究”,因为“风格特点的质必然反映在语言因素的量上”,“风格学应用它提供的数据,从质和量的统一上研究风格现象,进而认识风格的本质”[2]。……

登录APP查看全文

猜你喜欢

特征文本
初中群文阅读的文本选择及组织
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
如何快速走进文本
线性代数的应用特征