多策略混合的关键情感词识别方法
2021-12-03马婉贞陈淑婷李雅洁明涛
科技信息·学术版 2021年31期
关键词:机器学习
马婉贞 陈淑婷 李雅洁 明涛






摘要:随着数字化转型的新趋势到来,为解决企业审计或办公人员面对海量数字化文档工作效率低、重复工作等问题,本文在传统机器学习SVM的基础上,加入文本预处理、TF-IDF算法、LDA算法,构建了一套多策略混合的文本关键情感词识别模型。通过模型测试及与单一SVM分类器模型的对比实验,结果显示本文构建的混合模型F1值达到了89.08%,比单一SVM分类器模型提升了22.58%,证明该模型对关键情感词的识别有一定程度的提升,应用于办公或项目管控场景,可以有效提升企业审计办公智能化水平。
关键词:机器学习;情绪识别;TF-IDF;SVM;LDA
引言
随着互联网技术及各个政府机构或企事业单位数字化建设的快速发展,各类文本信息数据呈爆发性增长,为进一步提高办公文件审校效率,及时下发日常相关文件文书;进一步优化项目资料规范化管理检查流程,提升项目文档审计效率,降低工作成本,防范项目审计风险,本文对TF-IDF(词频-逆文档频率)算法、LDA(隐狄利克雷)算法及SVM(支持向量机)算法进行融合,以句子为最小分析单元,以办公文件敏感词及项目建设负面清单关键字为情感词典,计算整句情感词得分,输出整个文本内容情感倾向性,深入开展智慧办公和智能化管控场景应用,提升工作效率。
1.相关工作
现如今,对自然语言的文本数据分析已成为当下研究的热点。单从文本分类而言,其指的是在人为规定好的分类标准下,根据文本自身含义对文本数据进行分类的过程。……
登录APP查看全文
