京津冀协同发展报纸新闻主题发现及其关联分析
2021-10-21李海峰
科学技术与工程 2021年28期
李海峰
(河北大学计算机教学部, 保定 071002)
京津冀协同发展上升为国家战略,新闻媒体持续高度关注,积累了大量新闻报道网络信息资源。随着信息和媒体技术的快速发展,大规模新闻报道信息以文本方式存储。大规模文本信息使得人们在信息处理和检索上面临前所未有的挑战。为了深入理解京津冀协同发展新闻报道的整体概貌和主题分布,传统的阅读方法已经不能满足获取信息的需求。采用基于数据挖掘技术的自动化处理和组织方式,从大规模新闻集中开展主题发现和主题演化分析,为用户提供新闻信息整合服务,对京津冀协同发展国家战略的研究具有较高的理论价值和实践意义。
1 相关研究
1.1 新闻话题检测与跟踪
话题检测与跟踪(topic detection and tracking,TDT)是一项针对新闻报道进行信息识别、挖掘和组织的研究,主要包括报道切分、话题关联识别、新事件发现、话题追踪、话题发现等[1]。隐含狄利克雷分布(latent Dirichlet allocation,LDA)为经典的主题模型方法,利用词项在文档层共现提取文本中的语义信息,即主题,同时将词项矩阵转化为主题矩阵[2]。时序信息是新闻文本的重要特征,将时态信息引入主题模型,从时间维度分析主题的新生、继承、合并、分裂和消亡的演化过程,成为新闻文本挖掘的重要研究内容。Griffiths等[3]将时间信息引入主题模型,提出了话题演化模型理论。Wang等[4]提出了TOT(topic over time)模型,采用Beta分布对给定时间范围内的文本主题强度变化进行建模,将文本、词、时间三者相结合分析主题演化情况。……
登录APP查看全文
