基于Labeled LDA主题模型的医学文献自动分类法
2018-03-21,,
中华医学图书情报杂志 2018年10期
,,
随着医疗大数据的爆炸性增长,医学文献共享和知识挖掘的需求越来越迫切。如何提高医学文献分类的效率和质量,快速准确地识别这些海量文献的类别信息,从而挖掘出有价值的信息,成为该领域一个十分突出和重要的课题。虽然文本自动分类[1]作为一种成熟、高效的文本分类方法,已经在文本挖掘领域得到了广泛的应用,但分类效果还不够理想。
目前,关于自动分类的研究主要是利用SVM或KNN等分类算法[2-3],而基于主题模型的自动分类方法研究比较少,特别是针对医学领域文本自动分类方法的研究更少。
鉴于主题模型要考虑文本的语义信息可靠性较强,本文提出了一种基于Labeled LDA[4]主题模型的医学文献自动分类方法。它采用医学文本特定的方式构建训练文本,解决数据不平衡问题,调整模型的参数为最佳,选取了10个医学领域的文献进行实验,并用Labeled LDA主题模型与SVM方法进行对比实验,对实验结果进行分析总结,验证本文提出的自动分类方法的可靠性和效果。
1 实验设计
自动分类包括词典构建、语料库构建、算法对比与分析等阶段。
在语料库构建阶段,语料库数量庞大、各类别的覆盖度及类之间的不平衡问题突出,需要设计语料库构建规则,对语料库文档进行筛选,在保证各类完整性的基础上尽量减小语料库规模和计算规模,同时充分考虑类之间的平衡;在词典构建阶段需要对词进行规范,对已有词典文本进行处理,从而提高特征向量的纯度,同时还需要对多种分词算法进行对比分析和测试,选择合适的方法提高分词准确率和未登录词的识别率;……
登录APP查看全文
