APP下载

基于Labeled LDA主题模型的医学文献自动分类法

2018-03-21,,

中华医学图书情报杂志 2018年10期
关键词:分类文本模型

,,

随着医疗大数据的爆炸性增长,医学文献共享和知识挖掘的需求越来越迫切。如何提高医学文献分类的效率和质量,快速准确地识别这些海量文献的类别信息,从而挖掘出有价值的信息,成为该领域一个十分突出和重要的课题。虽然文本自动分类[1]作为一种成熟、高效的文本分类方法,已经在文本挖掘领域得到了广泛的应用,但分类效果还不够理想。

目前,关于自动分类的研究主要是利用SVM或KNN等分类算法[2-3],而基于主题模型的自动分类方法研究比较少,特别是针对医学领域文本自动分类方法的研究更少。

鉴于主题模型要考虑文本的语义信息可靠性较强,本文提出了一种基于Labeled LDA[4]主题模型的医学文献自动分类方法。它采用医学文本特定的方式构建训练文本,解决数据不平衡问题,调整模型的参数为最佳,选取了10个医学领域的文献进行实验,并用Labeled LDA主题模型与SVM方法进行对比实验,对实验结果进行分析总结,验证本文提出的自动分类方法的可靠性和效果。

1 实验设计

自动分类包括词典构建、语料库构建、算法对比与分析等阶段。

在语料库构建阶段,语料库数量庞大、各类别的覆盖度及类之间的不平衡问题突出,需要设计语料库构建规则,对语料库文档进行筛选,在保证各类完整性的基础上尽量减小语料库规模和计算规模,同时充分考虑类之间的平衡;在词典构建阶段需要对词进行规范,对已有词典文本进行处理,从而提高特征向量的纯度,同时还需要对多种分词算法进行对比分析和测试,选择合适的方法提高分词准确率和未登录词的识别率;……

登录APP查看全文

猜你喜欢

分类文本模型
一半模型
分类算一算
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本