APP下载

藏文停用词选取与自动处理方法研究

2015-04-21李天瑞

中文信息学报 2015年2期
关键词:文本实验方法

珠 杰,李天瑞

(1. 西南交通大学 信息科学与技术学院,四川 成都 610031;2. 西藏大学 工学院计算机科学系,西藏 拉萨 850000)



藏文停用词选取与自动处理方法研究

珠 杰1,2,李天瑞1

(1. 西南交通大学 信息科学与技术学院,四川 成都 610031;2. 西藏大学 工学院计算机科学系,西藏 拉萨 850000)

停用词的处理是文本挖掘中一个关键的预处理步骤。该文结合现有停用词的处理技术,研究了基于统计的藏文停用词选取方法,通过实验分析了词项频率、文档频率、熵等方法的藏文停用词选用情况,提出了藏文虚词、特殊动词和自动处理方法相结合的藏文停用词选取方法。实验结果表明,该方法可以确定一个较合理的藏文停用词表。

藏文停用词;词频统计;文档频数;熵

1 前言

在基于词袋模型的文本挖掘研究中,词作为文本的特征,在文本主题信息提取、文本摘要、文本分类、文本聚类、网络舆情分析、社会网络分析、网络搜索引擎与问答系统等研究中,往往组织成特征向量来表示文本内容。停用词的处理是文本挖掘中数据清洗的重要过程,能够大幅减少文本的无用特征,大大降低向量空间的维数、节省存储空间、减少计算时间,提高文本分析的能力和精确度。

停用词是指在文本中出现频率很高但是所包含的信息对体现主题没有多大贡献的词。在很多文本挖掘方法中,停用词被作为“噪音”处理。本文以藏文文本为研究对象,主要讨论藏文停用词的选取和自动处理方法。

本文的结构如下: 第2部分介绍了停用词处理的相关研究工作;……

登录APP查看全文

猜你喜欢

文本实验方法
记一次有趣的实验
在808DA上文本显示的改善
做个怪怪长实验
基于doc2vec和TF-IDF的相似文本识别
NO与NO2相互转化实验的改进
实践十号上的19项实验
用对方法才能瘦
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
四大方法 教你不再“坐以待病”!
捕鱼