APP下载

基于改进TextRank的铁路文献关键词抽取算法

2021-06-04赵占芳刘鹏鹏李雪山

北京交通大学学报 2021年2期
关键词:词汇文本模型

赵占芳,刘鹏鹏,李雪山

(1.河北地质大学 信息工程学院,石家庄 050031;2.河北省光电信息与地球探测技术重点实验室,石家庄 050031; 3.中国铁道科学研究院 科学技术信息研究所,北京 100081)

伴随着中国铁路的高速发展,国内外铁路科技信息资源越来越丰富.但铁路行业涉及较多专业技术领域,且各学科高度交叉融合,面对海量的信息资源,科研人员往往需要投入大量的时间和精力来进行信息的检索、筛选、翻译、分析和内化等工作.作为信息资源的基础性建设工作,如何对铁路科技信息资源进行有效地组织分类并提供智能化、个性化和专业化的检索与服务,已经成为铁路科技工作者亟待解决的重要问题[1-2].关键词自动抽取技术是解决该问题的关键技术之一.关键词自动抽取是指利用计算机技术从文献中抽取反映文献主题的词语[3],该技术可以为信息资源的自动标引、分类和智能检索提供基础元数据.

当前,关键词自动抽取技术主要应用基于统计学的方法、基于语言学的方法、基于机器学习的方法以及其他一些融合方法.基于统计学的方法是利用文本特征的统计信息进行关键词的抽取,例如词频[4]、词长[5-7]、词共现[8-10]、词性及句法特征[11-13]等.基于统计学的方法是目前应用较为广泛的关键词自动抽取方法,TF-IDF(Term Frequency Inverse Document Frequency)算法[4]和TextRank算法[8]是较为经典的算法;基于语言学的方法是从人类语言学的角度出发,对文本的词、句、段落、篇章等进行层级分析进而抽取文本关键字,例如基于词汇链的方法[14-16].基于语言学的方法由于关键词抽取的精确度不高,经常与统计学的方法结合使用;……

登录APP查看全文

猜你喜欢

词汇文本模型
一半模型
本刊可直接用缩写的常用词汇
一些常用词汇可直接用缩写
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
本刊可直接用缩写的常用词汇
基于doc2vec和TF-IDF的相似文本识别
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本