基于共轭分布和参数估计算法的文本大数据主题分析应用综述
2021-12-31朱颖奇李艳玲郭振东
内蒙古师范大学学报(自然科学汉文版) 2021年6期
朱颖奇, 李艳玲, 林 民,2, 郭振东
(1.内蒙古师范大学 计算机科学技术学院,内蒙古 呼和浩特 010022; 2,内蒙古师范大学 应用数学中心,内蒙古 呼和浩特 010022)
信息技术的提升、互联网大数据的发展、无纸化办公的普及,极大推动了自然语言形式文本的电子化进程。除新闻、社交信息这些依赖互联网快速传播的大规模文本数据之外,学术论文、医学资料、文化古籍等各种专业领域的文本数据也在大量产生和积累。上述以自然语言形式存储的海量文本都可以称为文本大数据。文本大数据的产生规律和数据本身蕴含的潜在信息,具有重要研究价值。文本的主题分析是语义分析中的基础和重点内容。文本主题是一个抽象概念,它由一组具有相关含义的词汇描述; 一篇文本通常包括多个主题,例如一篇关于奥运会的新闻稿中包含“运动”“旅游”等多个主题。
文本主题分析被应用于社会、科技、文化等多领域的多种任务中。首先,能够深入探究社会问题、现象,提高社会运行管理效率[1]。其次,能够多角度观察总结专业领域研究成果和现状,推动专业领域技术发展,指导领域发展方向[2]; 也可挖掘出政策主题和发展主题,以明确国家和国际政策的战略路线以及当前政策影响下相关专业领域的发展形势[3]。最后,文本主题分析对知识积累、文化传承也具有巨大作用,能有效提取和分析不同语言表示的领域知识文化主题信息,对增进民族地区通用语言与民族语言的知识共享和传播、传承各民族优秀文化具有重要现实意义。……
登录APP查看全文
